文章指出当前AI递归自我改进的乐观预测可能高估了实际进展速度,LLM写代码、生成合成数据等能力尚不足以支撑爆炸式自我提升,短期内仍需大量人类监督。
AI 行业目前最大胆的承诺是:AI 很快将能够自我改进,几乎不需要人类监督。LLM 已经能够编写代码、生成用于训练的合成数据,以及优化运行它们的计算机芯片。对 AI 爆发式进步的预测表明,研究者所称的"递归自我改进"已近在眼前。
但一项新研究表明,我们可能还需要一段时间才能达到那个水平。研究人员发现,AI 代理尚不具备进行开放式 AI 研究的能力——即没有明确答案、需要判断力和品味的高度自由化探索,而这可能是构建自我改进 AI 的核心要素。
普林斯顿大学 Peter Kirgis 和 Sayash Kapoor 领导的多机构研究小组发现,AI 代理能够解决从事 AI 研究所需的工程问题,但缺乏以顶级机器学习会议接收论文为标准的原创研究判断力和创造力。这一差距表明,一些关于 AI 研究自动化的夸张时间表可能超前于实证。
大多数现有的关于代理如何自动化 AI 研究的评估,都是考察它们完成具有可验证答案的狭窄任务的能力,比如解决工程问题或针对基准测试对小型语言模型进行后训练。但推动 AI 研究进展还需要开放式思维——选择一组假设、决定什么证据可以定论一个问题,或知道何时该推倒重来。
为了测试代理在这类能力上的表现,研究人员提出了一种名为"影子评估"的新评估方法,要求 AI 回答来自高质量未发表论文的研究问题。
研究人员让运行在名为 OpenClaw 的开源软件上的 Anthropic 的 Claude Opus 4.8 来处理这类问题,这些问题来自两篇提交给顶级机器学习会议 NeurIPS 2026 的论文。
第一个问题是,大语言模型的"人格"——决定其行为的要素——是否可以通过编辑模型的权重(训练过程中存储所学一切的数十亿个数字)来控制。另一个问题是如何设计一个检测器,用于指出基于电子表格数据进行预测的模型何时变得不可靠。由于这些论文尚未公开,代理无法从其训练数据中记忆答案或在网上找到它们。
代理获得了六天时间、3000 美元的 Anthropic API 额度、运行实验的 GPU 预算、自带的虚拟计算机,以及对公开网络的访问权限,来撰写一篇值得在顶级 AI 会议上发表的论文。论文的原作者像评价提交给会议的论文一样对代理完成的论文进行了评分。
两篇论文均被作者拒绝。
人类科学家发现,代理具备进行研究所需的全部工程能力。代理能够回顾文献、运行数百次实验并整理结果。
"但另一方面,代理在进行研究本身这件事上明确表现不佳,"Kapoor 说。它们进行了奇怪的实验(在某些情况下在小得可怜的合成数据集上测试假设),难以清晰地撰写自己的工作,并且没有对所在领域做出任何新颖贡献。"这些论文在顶级 AI 会议的质量要求上远远达不到标准,"他说。
这是因为代理难以拿出进行研究所需的创造力和判断力。它们没有充分探索不同的想法,而且过于迅速地押注于没有前景的方案。尽管代理提出了新颖且富有雄心的假设——类似于原作者自己最初使用的假设——但它们基于非常有限的数据就否定了这些假设。它们也无法从失败的方案中退步。它们可以进行小幅调整,但无法从根本上重新思考方法或从头尝试新的方案。
代理同样未能整合来自子代理或外部 AI 评审工具的反馈。它们没有修改方法论,而是收窄了论点并增加了警告声明。它们也无法有效利用资源,如 token、计算力和时间。它们也无法遵循关于不同研究阶段应花费多少时间或论文篇幅限制等方面的指示。
尽管存在这些失败,代理并没有做出研究人员所称的"奖励黑客"行为——隐藏或歪曲实验或数据。虽然子代理(即主代理分派来处理部分工作的辅助 AI)偶尔会产生幻觉或歪曲结果,但这些都被主控代理(负责监督项目的主导 AI)捕获了。
Kapoor 说,AI 模型擅长研究工程但不适合开放式研究的原因,可能归结于它们的训练方式。模型通过一种名为强化学习的训练方式擅长任何可以在训练中反复练习的任务,这种方式更容易应用于可以自动检查成功与否的任务。"但当任务本身是开放式的时候,为训练这些模型创造环境就更加困难了,"他说。
Kapoor 表示,该团队目前正在用 Anthropic 于 4 月推出的最先进的模型 Mythos 进行实验。该模型随后被特朗普政府要求满足各种安全限制,现在仅供经批准的机构使用。Anthropic 尚未回应置评请求。
这项研究存在一些局限性。它仅涵盖两篇研究论文,而且原作者知道他们评分的论文是由 AI 代理生成的,这可能影响了他们的评估。此外,研究人员在设计和执行研究方面拥有相当大的自主权,这意味着他们既有的信念和偏见可能会渗入结果。对开放式研究的评估在交换部分客观性的同时,提供了任何基准测试都无法提供的更丰富测试。
即便如此,这些结果可能也会给递归自我改进即将到来的说法泼一盆冷水。今年 6 月,Anthropic 发布了一篇题为"当 AI 构建自己"的博文,记录了其在加速自身开发的模型方面取得的进展。今年 7 月,OpenAI 宣传了一个事实:其新模型 GPT-5.6 Sol 帮助对一个小模型进行了后训练,为研究人员节省了数周的工作。
即便如此,这一发现也可能与 AI 公司在内部发现的情况相呼应。Anthropic 联合创始人 Jack Clark 在其 Newsletter Import AI 中写道,这与该公司尝试将 AI 安全研究某些方面自动化时发现的情况如出一辙。
"当今 AI 系统存在某种有价值的直觉创造力的缺失,而且尽管它们是非常能干的工程师,但它们似乎具有某种死板、公式化的思维特质,这可能阻止它们成为优秀的研究者,"他写道。他将 AI 系统缺乏创造力称为"对短期递归自我改进时间表的看跌信号"。
AI 公司确实有充分的动机开发能够快速加速自身进步的 AI 系统,就像它们让模型更擅长编程一样。OpenAI 已将构建自动化 AI 研究者作为明确目标,Anthropic 则将自我改进的 AI 确定为行业的下一个里程碑。
"如果有投资并且有意识地向这个方向努力,我觉得即使目前还在失败,也会有有趣的进展,"Najoung Kim 说。她是波士顿大学语言学和计算机科学教授,研究 AI 代理如何自动化 AI 研究,但并未参与这项研究。另一方面,AI 进步可能是分叉的。AI 系统可能在狭窄任务上突飞猛进——那种可以打分的任务——而在开放式研究上进展缓慢。
那么最大的悬而未决的问题是:开放式研究对递归自我改进有多关键——AI 系统是否能不依赖它、仅仅通过改进狭窄任务就能达到目的?"如果我们回顾该领域最大的进步,transformer 的发明或让我们取得大量 AI 进步的大型新架构的发明——所有这些确实都需要创造性的飞跃,"Kapoor 说。
"话虽如此,其他人持有这样的假设:实现变革性 AI 所需的一切,特别是实现递归自我改进的一切,都已经存在了,"比如让模型训练得更快、提升基准测试分数。
"这确实是目前价值万亿美元的问题,"他说。
Artificial intelligence
A startup claims it broke through a bottleneck that's holding back LLMs
Subquadratic has now shared more details about its new model. But some are still skeptical.
Will Douglas Heavenarchive page
A fundamental flaw leaves LLMs strikingly vulnerable to attack
It makes it easy to trick them into doing things they shouldn't, such as telling you how to sabotage an aircraft's navigation system.
Will Douglas Heavenarchive page
Anthropic found a hidden space where Claude puzzles over concepts
A new technique has let the company probe deeper than ever into the weird workings of an LLM.
Will Douglas Heavenarchive page
Claude Science is Anthropic's newest flagship product
The company is doubling down on AI for science.
Grace Huckinsarchive page
Get the latest updates fromMIT Technology Review
Discover special offers, top top stories, upcoming events, and more.