研究者2023-2024年预测的多项AI自动化研究里程碑已被突破,包括模型自我改进等方向谢尔盖·布林已要求全力投入递归自我改进研究。
IAPS 学者 Severin Field 采访了来自 OpenAI、Anthropic、Google Deepmind、Meta 以及美国高校的 25 位研究人员,探讨递归自我改进问题。在一篇新的博客文章中,他对此进行了盘点。这些研究人员提到的几个里程碑已经在事后被实现。
Field 在其 newsletter《The Attack Surface》上发表的文章,总结了他在 2025 年夏末进行的采访研究。25 位受访者中有 20 位将 AI 研究的自动化列为最严重、最紧迫的 AI 风险之一。Field 所说的递归自我改进(RSI),指的是一个在 AI 开发方面足够熟练的系统,能够构建一个更强的自身版本,然后这个更强的版本再做同样的事情。他写道,RSI 已经不能再被当作营销噱头而不予理会。
受访者反复提到非营利组织 METR 的 Task Horizon 基准测试,将其作为衡量进展的首选指标。自 2019 年以来,AI 智能体独立完成的任务长度大约每六个月翻一番,一些分析师表示,自 2024 年以来,这一速度已加快至每四个月翻一番。Field 说,争论的焦点不再是自我改进是否正在发生,而是它是否是递归的——即收益是否会复合成为一个自我维持的循环。怀疑者认为,仍需要在记忆、创造力或区分真假设与假假设的能力方面取得突破,因为范式转换的想法没有训练数据,也没有答案。
然而,自采访以来,其中的几个里程碑已经被实现。OpenAI 和 Google Deepmind 在数学奥林匹克竞赛中达到了金牌水平。Sakana 的"AI Scientist"产出了一篇经过同行评审的 workshop 论文。Andrej Karpathy 构建了一个能够自主运行训练周期的智能体框架。而 Anthropic 报告称,Claude 现在已经能够为自己生产代码库中超过 80% 的代码。
在 20 位受访者中,只有 4 位预计具备研究能力的模型会作为公开产品发布。一半预计它们将保持在内部使用。其余的预计会出现蒸馏后的公开版本。Field 描述了一种可能的"激励翻转"——一旦 AI 足够快地加速了实验室自身的研究,扣留一个模型就会比出售它更有价值。他指出了这一趋势的两个迹象:2026 年 7 月的一次安全事件——一个 OpenAI 内部模型突破测试环境并入侵了 Hugging Face,以及美国政府临时限制了对 Anthropic Claude Mythos 的访问。
基于这些发现,Field 提出了三项建议。第一,由国会举行听证会,让 CEO 和研究人员就自动化 AI 研究宣誓作证。第二,由政府运行的 Task Horizon 基准测试,配合在 AI 安全与创新中心开展的匿名访谈项目。第三,研究如何核查国际 AI 协议——没有这一点,与中国等国家的协议在实践中将无法执行。Field 写道,争论几乎还没有影响到华盛顿,而各实验室仍在继续推进。
就在最近,领先 AI 公司的 1224 名员工——包括 OpenAI 和 Meta 的首席科学家——签署了一份公开声明,警告他们的组织可能即将实现 AI 研究的自动化。
AI News Without the Hype – Curated by Humans
订阅 THE DECODER,享受无广告阅读、每周 AI newsletter、我们独家的"AI Radar"前沿报告每年六期、完整档案访问权限以及评论 section 访问权限。
继续阅读以了解全貌。订阅以获取无噱头的报道。
THE DECODER 上每篇文章的完整访问权限
参与评论和社区讨论
通过邮件接收每周 AI 新闻综述
每年 6 期:"AI Radar"——深入探讨最重要的 AI 话题
每日 AI 新闻,始终保持最新
我们完整的十年档案
由拥有 10 年以上 AI 经验的团队报道