Anthropic公布其R&D自动化指数,澄清误解:26%指模型完成大部分任务但需人工审核,完全自主执行为0%,90%参与率是协作级别。
Anthropic 发布了其首个内部 R&D Automation Index,指出 Claude 在其人工智能研发工作中承担了 26% 的任务,涉及超过 90% 的整体 R&D 工作流。
这一披露立即引发了一轮报道,声称模型正在构建自己的后继者。但当你审视该实验室如何定义其自动化层级时,实际操作情况要狭窄得多:Anthropic 内部的完全无人值守自动化率目前为零。
该指数将内部工程与研究任务划分为三个操作级别:
Leads(26%):模型从高层提示完成端到端任务的大部分,但由工程师监督运行,并在结果进入生产环境前进行验证。
Collaborates 或更高(90%+):模型在直接人工迭代下处理大量代码、数据解析或测试生成。
Fully autonomous(0%):系统在无人工干预的情况下规划、执行、验证和部署。
相关披露中提到,2026 年 8 月 Anthropic 内部集群中约有 30,000 个活跃 AI agent 会话。这一数字反映的是自动化批量工作力,而非一个自己做产品决策的人工智能研究员。
在任何现代模型开发流水线中,绝大部分工程时间都花在操作性苦工上:
这些都是高摩擦、有边界的 workflow。开发者给 agent 一个目标 schema、一个 eval 脚本和一个 git branch,然后在 agent 完成后审查 PR diff。
当 Anthropic 说 Claude 承担了 26% 的内部工作时,意味着工程师可以将有边界的任务委托给后台 worker 进程,而不必手动编写每个测试工具。模型生成草稿产物,但人类工程师仍然决定资助哪些假设、信任哪些 eval 套件,以及发布哪个 checkpoint。
递归自我改进的概念假设了一个自主循环:AI 编写一个更好的自己版本,部署到生产环境,并在无人工审批的情况下加速下一个周期。
Anthropic 的指标揭示了为什么这种心智模型在生产软件中失效。编写代码在模型开发中很少是主要瓶颈。真正的瓶颈是计算预算、数据集质量、硬件可靠性和评估设计。模型无法自主分配它不控制的集群,也无法根据未编写的标准评估安全阈值。
在 30,000 个活跃 agent 会话中实现零无人值守执行,这展示了 2026 年 agent 系统的现状。它们是重复性工程步骤的有效力量倍增器,但它们仍然是绑定在人工验证上的工具。