研究团队分析 769 个任务日志:AI 代理提供高达 55% 的方法建议,但人类做出超过 85% 的最终决策;无 AI 辅助时 1/3 任务不会被尝试。
当 AI 智能体帮助构建新的 AI 模型时,谁来做决策?一个由复旦大学研究人员参与的团队研究了自己的项目来寻找答案。他们分析了 56 名参与者的 700 多条任务日志,以及所用智能体的日志。
该项目围绕开发一款名为 Atria Dawn Preview 的智能体语言模型展开,该模型基于混合专家架构,拥有 7440 亿参数,专为研究和工程任务设计。
该模型的训练流程将每个任务与真实执行环境绑定。它调用工具、生成中间结果,并通过外部信号(如测试、指标或源代码证据)进行校验。团队表示,在 16 项基准测试中,该模型在 5 项上领先,包括网络搜索和网络安全,但在整体上并不领先于竞争对手。
Atria Dawn Preview 在 AutomationBench、CyberGym 和 MLE-Bench Lite 中领先,但在 GDPval 和 SWE-Bench Pro 中落后。| 图片来源:Atria 团队

在审查的任务中,96.5% 使用了 AI。在项目过程中,参与者将越来越多的工作交给智能体处理。在四周内,智能体操作与人工输入的中位数比例从 11 上升到 28.5。团队警告说,不应将此解读为自主性的增长。每一次人类决策都会导致更多的智能体步骤,但这并不意味着智能体自己在做更多的决策。
在四周内,每次人工输入对应的智能体操作中位数从 11 上升到 28.5。| 图片来源:Atria 团队

参与者还被问及,在相同的范围和质量下,他们是否能够在没有 AI 的情况下完成分配给他们的任务。在 455 项已完成的人工智能辅助任务中,有 151 项被评定为没有 AI 不可行,约为三分之一。这些任务分布在 56 名参与者中的 27 人身上,因此并非仅来自少数高级用户。在这种情况下,AI 并没有加快现有工作,而是使原本永远不会开始的工作成为可能。
参与者表示,约三分之一的人工智能辅助任务在没有 AI 的情况下无法完成。| 图片来源:Atria 团队

在方法和参数方面,最常见的模式是"AI 提议,人类选择",占 55.4%。总体而言,人类做出了 85.5% 的方法和参数决策,而 AI 仅做出了 9.2%。在目标和范围的决策中,人类在 93.4% 的情况下做出了最终决定。
AI 的提议比例因决策类型不同从 17% 到 55% 不等。而 AI 最终决定的比例始终保持在个位数。谁来提出选项差异很大,但人类始终做出大多数的最终选择。即使在 151 项被评定为没有 AI 不可行的任务中,人类在 95.4% 的情况下选择了目标。
智能体经常提供方法提议,但人类在超过 80% 的情况下做出最终决定。| 图片来源:Atria 团队

同样的模式也出现在出现问题时。在 588 项有记录难度的任务中,76% 通过人工干预推进,23% 由智能体自行解决问题。人类帮助几乎总是以信息的形式出现,或者是添加背景信息或澄清需求(35.2%),或者是诊断问题并切换方法(34.7%)。人类很少亲自动手。部分编辑占 3.2%,完全接管仅占 0.7%。
在四分之三的问题案例中,人工干预推动了工作进展,主要是通过提供背景信息或诊断,而非接管工作本身。| 图片来源:Atria 团队

当 AI 输出需要修改时,AI 在收到人类反馈后有 75.4% 的情况下自行处理了修改。瓶颈在于人类的判断,而非执行。
团队描述了 AI 角色的三个阶段:从研究对象,到个人任务的工具,再到项目合作伙伴。在当前角色中,AI 在人类设定的目标内起草和调整计划。一个推测性的第四阶段将涉及递归自我改进,由更强的模型产生更强的后继者。
Atria 团队描述了 AI 从研究对象到项目合作伙伴的演进。下一个阶段——递归自我改进——仍然是一个开放问题。| 图片来源:Atria 团队

作者表示,模型可能在训练任务上表现更好,却在开发其后继者方面并没有变得更好。AI 如何在结果出来之前提出多样化的研究方向并评估其价值,仍然是一个开放的问题。
当每个决策都建立在比任何人类所能审查的更长的智能体工作链上时,监督就变得困难。团队写道,在最坏的情况下,人类成为只能对他们所看到的内容盖橡皮图章的审查者。许多参与者的智能体也以自主模式运行,以避免在长时间运行中不断需要批准来中断。这种边界是出于便利而划定的,而非对 AI 应拥有多少权限的任何深思熟虑的选择。
这篇论文正处于关于递归自我改进的争论之中。Anthropic 认为开发自己后继者的 AI 比预期更早成为可能,因此 CEO Dario Amodei 呼吁为行业设置速度限制。据 Anthropic 称,人类目前在该公司的研究方向决策中只占个位数的比例。OpenAI 在其整个开发生命周期中使用 GPT-5.6 Sol,而 Google 和 DeepMind 通过 Dream-RSI 让 AI 智能体通过记录的搜索轨迹探索替代策略,尽管他们只改进搜索策略本身,而非模型本身。
领先 AI 公司的上千名员工最近警告说,他们的组织可能即将实现 AI 研究的自动化。普林斯顿大学和英国 AI 安全研究所的一项独立研究得出了与 Atria 团队发现更为一致的结论:前沿模型可以处理研究工程工作,但在真正重要的判断决策上仍然失败。