Atria 研究发现:模型开发中 AI 智能体承担更多工作,但人类仍握最终决策权
Atria 团队在开发 744B 参数模型 Atria Dawn Preview 期间记录人类与 AI 智能体的分工,发现 AI 承担了更多执行工作,但人类仍做出绝大多数最终决策。
Atria 团队在开发 744B 参数模型 Atria Dawn Preview 期间记录人类与 AI 智能体的分工,发现 AI 承担了更多执行工作,但人类仍做出绝大多数最终决策。
MentalHealthBench 是一个由专家指导的基准,专注于现实心理健康对话场景,评估 AI 响应的帮助性与安全性。
微软研究院推出 MindTopo 基准,评估多模态大语言模型对连通、封闭、排序、分离和打结等拓扑关系的理解,发现模型在静态识别上远优于交互规划。基准在五个拓扑类别上分别测试推理与规划,并在可控模拟器中提供精确真值以分离感知与规划两类失败。当前模型常在规划多步后失去结构关系或提出违反物理约束的动作,静态识别也会因漏看墙或开口而失败。
针对长程交互中递归摘要带来的性能损失,Berkeley AI Research提出ABBEL框架,将摘要组织为自然语言信念状态并引入信念评分以监督其信息内容。在CollabBench协作编码环境中,ABBEL将全上下文模型的性能差距缩小约50%,训练步数由100步减至50步,同时峰值上下文token大幅降低。
Google DeepMind 发布新的分布式训练架构 Decoupled DiLoCo,通过解耦计算岛实现跨数据中心低带宽训练,并在硬件故障时隔离影响继续训练。该架构在 120 亿参数模型上跨美国四个区域以 2-5 Gbps 网络训练成功,速度比传统同步方法快 20 倍以上,并支持混合不同代际硬件(如 TPU v6e 和 v5p)。
推荐理由:该架构以解耦计算岛实现低带宽跨数据中心训练,抗硬件故障并支持混合硬件代际,可帮助理解分布式训练的前沿方向。
GRASP是一种新的基于梯度的规划器,用于学习动力学(世界模型),通过将轨迹提升为虚拟状态实现时间并行优化、直接向状态迭代添加随机性进行探索、重塑梯度以避免高维视觉模型中的脆弱梯度,从而让长视野规划变得实用。这项工作针对现代世界模型在长视野规划中的病态优化、非贪心局部极小和高维空间失效问题,提出了更鲁棒的梯度规划方法。
研究者在论文中证明,word2vec 在现实训练条件下可归结为无权重最小二乘矩阵分解,且其学习动态有闭式解——最终学到的词嵌入表示正是对特定矩阵做 PCA 的结果。这些隐特征依次对应可解释的概念,如名人传记、政府管理等主题。