GPT-6 Astra在不同基准测试中表现矛盾,Epoch AI评分169分领先,但Artificial Analysis认为其未超越前代;最大亮点是ARC-AGI-3效率首次超过人类平均水平,Chollet因此提前了他的AGI预测时间线。
OpenAI 的 GPT-6 Astra 在各项基准测试中得到了相互矛盾的结论。Epoch AI 将其排在榜首,而 Artificial Analysis 则认为它并不比前代产品更强。最大的惊喜来自 ARC-AGI-3,在该测试中 Astra 首次以比普通人更高的效率完成了任务。ARC Prize 负责人 François Chollet 称这一进展"比预期快了 2 倍",并正在上调他对 AGI 的预测。
两个独立实验室各自将数十项独立测试汇总为一个综合得分,但得出了相反的结论。Epoch AI 综合了超过 50 个基准测试,将 GPT-6 Astra 以 169 分排在第一位,领先于 267 个模型。Artificial Analysis 测试知识、编程和文本理解能力,给 GPT-6 Astra 打出了 61 分,与前代完全持平,落后于 66 分的 Claude Fable 5.1。
Astra 显然比自己的前代更贵。OpenAI 对每单位处理的文本收取 2.5 倍的费用,这使得单个任务成本比使用 Sol 时高出约 75%。与 Anthropic 相比,情况则相反。在编程任务上,Astra 在 Artificial Analysis 的测试中获得了与 Claude Fable 5 相同的分数,但每个任务的费用不到后者的一半。原因是该模型的节省程度。它只需要 Sol 所用计算步骤的三分之一,是 Opus 5 的五分之一。
*GPT-6 Astra 在 xhigh 推理努力级别;最大可达 97.5%。ARC-AGI-1 现已被认为基本饱和。
在 Coding Agent Index 上,Astra 以约 Sol 三分之一的 token 用量达到 67 分,而 Fable 5.1 以 70 分领先。在 AA-Omniscience 上,幻觉率从 92% 降至 51%。同时,该模型在 GDPval-AA v2 上损失了约 80 Elo 分,在银行支持、SciCode 和长上下文推理任务上也有所下滑。
Epoch AI 报告称,在新的 FrontierMath Erdős 基准测试中,GPT-6 Astra 是唯一在每次尝试预算 300 美元的情况下,用 Lean 验证的证明解决了 68 道开放 Erdős 问题中 2 道的模型。另外还有三个解决方案来自非标准化的额外运行,消耗了超过 22 万美元的计算资源,但 Epoch 表示这些不计入得分。
仔细看 Epoch 的单项数据,GPT-6 Astra 和竞争对手 Fable 5.1 迄今为止是在不同的测试基础上测量的。Astra 在数学、知识和谜题方面领先。Fable 5.1 在几乎所有编程测试中都保持最高分。但 Epoch 目前只记录了 Astra 的一个编程分数,而且那一次是在中等推理级别下运行的。
ARC-AGI-3 显示大幅跃升
最明显的跃升出现在 ARC-AGI-3 上。该测试将 AI 置于陌生的游戏世界中,没有人向它解释规则和目标。模型需要通过试错来弄清楚该做什么。GPT-6 Astra 在约 26,000 美元测试成本下达到 62.7%。其前代 GPT-5.6 Sol 为 7.78%,竞争对手 Claude Opus 5 为 30.16%。Fable 5 和 Fable 5.1 尚未进入该基准测试。
OpenAI 报告的 99.9% 是在不同条件下取得的。在该设置中,Astra 可以使用 OpenAI 构建的 harness,使推理链在各个独立请求之间保持连续,并自动总结长运行。按 ARC Prize 的测量,在 167 个两个设置都解决了的游戏推理对中,这些运行比内部 harness 快了约 3.66 倍,token 用量减少了 49%。
Harness 的使用及其带来的性能提升,在 GPT-5.6 Sol 时期就已经是 ARC Prize 和 OpenAI 之间的一个症结。ARC Prize 指出,只有 62.7% 这个较低的数值——在内部 ARC harness 上运行——才能实现供应商之间的公平比较,尽管他们计划未来也公布供应商 harness 的数据。
在这里,更多的思考反而降低费用
思考努力与成本之间的关系不同寻常。通常更高的推理级别会使测试运行更昂贵。但对 Astra 来说情况相反。在标准 ARC 脚手架上,成本从无推理时的 49,791 美元下降到最大推理时的 26,098 美元,而分数从 35.2 上升到 62.7%。根据 ARC Prize 的说法,原因是 Astra 以更少的步数解决了游戏,这意味着更少的模型调用和更少的 token。一个值得注意的异常是:"低"级别得分为 17.5%,比完全不进行推理还要差。ARC Prize 对这个异常没有评论,但 GPT-6 Astra 在其他基准测试中表现出,它可以在不需要推理的情况下解决更长周期的任务,这是由于其新架构可能在生成第一个 token 之前就在内部循环处理。
作为比较,人类测试者每 90 分钟的会话获得 115 美元,外加每个已解决游戏 5 美元,所以大约九次尝试每次约 12.78 美元。但这笔钱主要用于支付时间和参与意愿。如果只将大脑的代谢能量作为电力来计算,ARC Prize 得出的数字是每个游戏 0.067 美分。
比原始分数更有趣的是效率。在发布之前,ARC Prize 约有 500 名测试者在没有预先筛选的情况下玩耍,并记录了每个级别中解决它的人的中间移动次数。在使用 OpenAI 脚手架的运行中,Astra 平均以略多于一半的移动次数在 96% 的级别中以少于该中间值的移动次数解决了问题。与通常的成本衡量标准不同,这个数字不追踪所消耗的计算量。它追踪的是模型在掌握环境之前需要多少经验。
这正是组织者预期人类会保持持久优势的地方。对于暴力方法来说仍然如此,但有了顶级模型,ARC Prize 看到了一个几乎二进制的模式。一旦模型弄清楚了这个机制,它的执行就进入了人类效率范围。
Astra 发明了自己的符号
为了做到这一点,Astra 保留了自己的笔记,并发明了一种类似代数的简写方式,用它来记录对象、坐标、规则和开放计划,例如 extend8 to3; retract10 to2 作为有序的动作序列,或 Turn 5: P=(24,20), empty, facing west 作为状态笔记。ARC Prize 在其他模型上也看到了类似的行为,但特别指出 Astra 的精确性和信息密度。在标准 harness 上,这是一项重要技能,因为模型没有保存到自己可见笔记中的所有内容都会丢失。
ARC 联合创始人 François Chollet 在 X 上将其描述为"为每个游戏和级别高度高效、即时进行的符号世界建模"。该模型甚至"开发了自己的简写 DSL 来表示游戏内情况",其核心实际上是"一种特定于游戏的代数符号"。对 Chollet 来说最重要的是这种行为的来源:"Astra 表现出的符号建模行为,我们之前只在复杂的 harness 中见过,因此 harness 的能力正在越来越多地转移到模型本身。"
Astra 创建了一个密集、紧凑的符号世界模型来完成 ARC-AGI-3 环境。
例如,在环境 s5i5 中,Astra:
记录了当前级别、中心方向和机制长度:"L8: hub q2 (8↓). Lengths: 14=1…"
它将操作映射到精确的控制:… pic.twitter.com/tMHP002mkB
— ARC Prize (@arcprize) 2026 年 9 月 3 日
第三个测试环境展示了 Astra 在使用外部工具时能做什么。PRO-LONG 是一个由第三方开发的 agent 框架,ARC Prize 团队早早将其部署为 ARC-AGI-3 的红队合作伙伴——也就是说,用于系统地探索基准测试的极限。与标准设置不同,模型提供了一个沙箱,它可以在其中执行自己的代码。
Astra 利用了这一点,为每个游戏编写了小型的程序库:游戏板的解析器、状态模型、搜索算法和规划器。在一个包含守卫的迷宫游戏中,路径规划器、战斗规则模块、巡逻移动模型以及持续将自身预测与观察进行比较的脚本被逐一开发出来。ARC Prize 没有观察到任何试图逃离沙箱的行为。这些运行与人类测试条件不可比较,因为测试对象既没有代码解释器也没有记事本。这里测量的是模型和自建工具的联合性能。
Chollet:没有 AGI 的证据,但比预期更快
ARC Prize 明确不将这些结果解释为通用人工智能的证据。"目前我们对系统的了解只是其基准测试分数,"Chollet 写道。当 ARC-AGI-3 发布时,他们在每次演示中都强调了一点:"解决它不是 AGI 的证明。它不是被设计为终点线。"虽然该基准测试确实测试了 AGI 系统预期的正确定性属性——即不确定性下的探索、无指导的适应以及从稀疏数据中进行因果世界建模——但它是在"小规模"上做的。这些游戏运行的时间尺度比现实世界的任务短了好几个数量级,因此需要更少的数据、更少的建模复杂性和更少的即时学习。
当 ARC-AGI-3 大约六个月前发布时,Chollet 在回答关于饱和的问题时说"大约一年",取决于对基准测试的方法有多专注。因此,Astra 比预期"快了大约两倍"到来。"我相信进展的速度会让很多人惊讶,而且新模型的能力将挑战人们基于早期模型形成的 AI 认知。"当被用户问到他早期的 2030 年 AGI 预测是否仍然有效时,Chollet 简洁地回答:"更快了,因为进展比我预期的更快。"
结果带来了另一个基准测试。根据 Chollet 的说法,ARC-AGI-4 自 ARC-AGI-3 发布以来一直在开发中,计划于 2027 年第一季度发布。基准测试是一个与模型共同发展的持续过程,始终针对 AI 与人类智能之间的剩余差距。该组织认为 ARC-AGI-3 本身相当有限:确定性机制、封闭的终点目标,以及没有开放现实世界的表征。下一代旨在探索递归自我改进和开放创新等领域。