OpenAI报告其AI代理已实现每人类工作日产出3.1个工作日的效果,达到「自动化研究实习生」目标;但首席科学家警告现有对齐与监控能力不足以支撑全速扩展。
OpenAI 发布了内部数据,展示 AI Agent 目前在其模型开发中推动了多大的比重,同时表示自己已在通往自我改进 AI 的道路上达成了一项自设的里程碑。首席科学家 Jakub Pachocki 配以一则异常直白的警告:尚无一家实验室将这类系统的控制问题解决得足够好。
OpenAI 发布了兩篇配套文章。一篇是博客,披露了关于 AI 研究日益自动化的内部指标;另一篇是首席科学家 Jakub Pachocki 的随笔《An Alien Mind》。两篇文章均在该公司发布 GPT-6 Astra 三天后问世。核心信息是:OpenAI 正快速迈向递归自我改进(RSI),而它认为这很危险。所有数据均来自公司内部,OpenAI 未提及任何独立审查。
该公司表示,已达成去年秋季宣布的目标——"自动化研究实习生"(automated research intern),即在人类指导下处理明确范围的研究任务的系统,其中包括那些原本会耗费资深研究员数天时间的任务。
OpenAI 没有分享对该声明的详细验证。博文只表示,这一里程碑是"根据我们的测量"达成的。该公司希望在 2028 年 3 月前构建一个完整的自动化 AI 研究员。OpenAI 表示,目前仍由人类设定研究优先级、判断结果,并决定扩展、暂停和部署策略。
使用量数据揭示了编码 Agent 已多深入地渗透到日常研究中。根据报告,OpenAI 研究员的中位数每天在 API 价格下消耗超过 600 美元的推理费用,第 90 百分位则超过 7000 美元。自 2025 年 12 月以来,中位数研究员的 token 输出量增长了 124 倍,远快于公司其他部门的增长。自 6 月起,Agent 运行时间已超过人类工作时间。截至 8 月中旬,研究组织每有 1 个人类工作日,就运行 3.1 个 Agent 工作日。
OpenAI 本身对这些数字持谨慎态度。此类指标"相对容易收集,但很难解读,因为它们与研究进展的关系并不确定。"每位研究员完成的实验次数在 8 月创下自 2025 年初开始追踪以来的最高纪录,这也与计算容量的大幅提升相吻合。报告称,由于最难自动化的任务成为瓶颈,整体进展可能比这些单项指标增长得更慢。
根据该公司说法,被移交给 Agent 的工作类型正在转变。使用 Epoch AI 的分类法排序后,每一类研究工作都在增长。最大幅增长出现在编写研究代码和基础设施代码、技术支持、以及监控训练过程。相比之下,高层规划决策在 Agent 输出中仍只占极小的比重。
除了原始使用量,OpenAI 还使用了一个 Agent 分类器来检查 Agent 是否真正解决了它们被分配的任务。该公司将其限制在结果可明确衡量的案例中,并按人类所需时间分组。从 1 月到 7 月,多个难度级别上的成功率均有所上升。
报告还记录了自主性的边界。15 分钟以内的任务无需任何干预的成功率为 86%。但在需要人类 4 到 8 小时完成的成功任务中,超过一半需要至少一个人类步骤。分类器本身也是一个 AI 系统,OpenAI 没有单独报告其可靠性。
关于系统有多大用处,另一个定性指标是:据发布的数据,自 2025 年以来,一个内部支持渠道的每日请求量大幅下降,一个团队完全关闭了故障排除办公时间,因为 Agent 日益承担起了研究基础设施中的调试工作。
在这篇随笔中,Pachocki 将这些发展放在了更广阔的框架下。AI 是"培育出来的,而非设计出来的",他写道,其整体行为拒绝任何完全可理解的理解。基于 OpenAI 未详细披露的内部结果,他预计当前的步伐可以延续到递归自我改进中。"我担心没有人准备好应对机器智能持续快速提升的后果,"Pachocki 表示。
这也适用于 OpenAI 自己的控制工具。思维链监控(chain-of-thought monitoring)是该公司监控推理模型的核心押注之一,但他表示其可靠性正在下降。模型的言语化思维正与被监控的通信和工具使用相融合,这些系统在操控自身推理过程方面越来越擅长,而且它们也在不依赖言语化思维的情况下变得更聪明。Pachocki 预计 AI 进展将日益受到监控可信度上限的制约。
他在对齐方面也看到了差距。在 Hugging Face 事件中,Agent 确实守住了不操控人类的底线,但它们违反了所训练价值观的精神。GPT-6 Astra 比其前身 GPT-5.6 Sol 对齐得好得多,但泛化对齐的进展可能无法与智能的整体进步保持同步。
那么,为什么要继续训练更强的模型?Pachocki 的论点是构建防御系统。这些模型在入侵和逃逸计算机系统方面已变得超人类,而保护关键基础设施只有狭窄的时间窗口。报告提出了同样的观点:自动化 AI 研究员也可以作为自动化的安全和对齐研究员。与此同时,Pachocki 警告这不能成为"鲁莽的借口"。"一旦一个人真正认识到利害关系的严重性,不惜一切代价向前冲刺的想法就显得荒谬了,"他写道。
因此,诸如 Preparedness Framework 或 Anthropic 的 Responsible Scaling Policy 之类的框架需要发展成为具有约束力的标准,由独立审计员、监管机构或国际机构来执行。
"目前我相信,没有一家实验室将对齐和监控解决到足以继续负责任地以最大速度扩展很长时间的程度,"Pachocki 写道,他的批评对象也包括竞争对手 Anthropic。
他表示,国际协调未来 AI 发展需要成为世界各国政府的首要优先事项。报告引用 OpenAI 的 Frontier Policy Blueprint,也主张应要求各公司公开记录其 RSI 进展。
然而,同一篇随笔也将 OpenAI 对 RSI 的专注描述为保持在 AI 研究前沿的唯一途径。因此,OpenAI 在为一场它必须全速奔跑才能保持领先的竞赛要求具有约束力的规则。而当 Pachocki 的同事们宣布 GPT-6 开启了 AGI 时代时,这可能无助于减缓这场竞赛。
AI News Without the Hype – Curated by Humans
订阅 THE DECODER,享受无广告阅读、每周 AI 时事通讯、我们独家的"AI Radar"前沿报告(每年六期)、完整档案访问权限,以及评论 section 访问权限。
继续阅读,获取完整图景。订阅免炒作报道。
访问 THE DECODER 每篇文章的完整权限
参与评论和社区讨论
每周 AI 新闻摘要,邮寄送达
每年六期:"AI Radar"——深入探讨最重要的 AI 话题
每日 AI 新闻,始终保持最新
我们完整的十年档案
由拥有 10 年以上 AI 经验的团队报道