o3 模型在 ARC-AGI 测试中创造历史最高成绩,标志着通用推理能力的重大突破。
OpenAI 已发布新版 o3。阅读下文分析,了解它与本文此前测试的预览版有何不同。
更新(2025 年 4 月 16 日):OpenAI 已正式发布 o3。OpenAI 已确认,此版本与我们在原文中测试的版本并不相同。请参阅相关详细信息。我们将很快公布已发布版本 o3 的最新测试结果。
OpenAI 的新系统 o3——使用 ARC-AGI-1 Public Training set 训练——在我们的 Semi-Private Evaluation set 上取得了突破性的 75.7%,同时符合公开排行榜规定的 1 万美元计算成本上限。高算力配置(计算量为 172 倍)的 o3 则取得了 87.5%。
这是 AI 能力一次令人意外且意义重大的阶跃式提升,展现了 GPT 系列模型前所未见的新任务适应能力。作为背景参考:ARC-AGI-1 的成绩从 2020 年 GPT-3 的 0%,到 2024 年 GPT-4o 的 5%,花了整整 4 年时间。o3 的出现,意味着我们过去对 AI 能力的所有直觉都需要重新校准。
ARC Prize 的使命并不局限于我们的第一个 benchmark,而是要成为通往 AGI 的北极星。我们也很高兴能在明年继续与 OpenAI 团队及其他参与者合作,共同设计下一代经得起时间考验的 AGI benchmark。
ARC-AGI-2 将沿用相同形式——经验证对人类很容易、对 AI 更困难——并与 ARC Prize 2025 同时发布。我们承诺会持续举办 Grand Prize 竞赛,直到有人创造出得分达到 85%、高效率且开源的解决方案。
继续阅读完整的测试报告。
更新(2024 年 12 月 20 日):在最后一场“12 Days of OpenAI”活动中,ARC Prize 与 OpenAI CEO Sam Altman、研究高级副总裁 Mark Chen 一同现场展示了 o3 的性能结果。可观看活动录像。
我们使用两个 ARC-AGI 数据集测试了 o3:
Semi-Private Eval:包含 100 道私有任务,用于评估过拟合情况
Public Eval:包含 400 道公开任务
按照 OpenAI 的要求,我们在两个计算量级上进行了测试,并采用不同的样本数量:6(高效率)和 1024(低效率,计算量为 172 倍)。
以下是测试结果。
2025 年 3 月 24 日注:o3 的成本估算已更新为采用 o1-pro 的定价。待 o3 的官方定价公开后,我们将再次更新。其计算量约为低算力配置的 172 倍。
2025 年 12 月 10 日注:o3 的成本估算已更新为采用 o3-pro 的定价,即每百万 Token 80 美元。
关于“tuned”的说明:OpenAI 表示,我们测试的 o3 使用了 Public Training set 中 75% 的数据进行训练,但没有透露更多细节。我们尚未测试未使用 ARC 数据训练的模型,因此目前还无法判断其性能中有多少来自 ARC-AGI 数据。
由于推理预算可以动态变化,现在报告性能时,效率——例如计算成本——也成了一项必需指标。作为初步衡量效率的代理指标,我们记录了总成本和每道任务的成本。整个行业仍需进一步研究,找出最能衡量效率的指标,但从方向上看,成本是一个可靠的起点。
75.7% 的高效率配置成绩符合 ARC-AGI-Pub 的预算规则(成本低于 1 万美元),因此有资格登上公开排行榜第一名!
低效率配置取得了 87.5%,成本相当昂贵,但它仍然表明:随着计算量增加,模型处理新任务的性能确实会随之提高——至少在当前计算量级以内如此。
尽管每道任务的成本很高,但这些成绩并不只是对 benchmark 暴力堆算力的结果。OpenAI 的新模型 o3 标志着 AI 适应新任务的能力出现重大飞跃。这并非单纯的渐进式改进,而是真正的突破;与 LLM 此前的局限相比,它意味着 AI 能力发生了质的变化。o3 能够适应自己从未遇到过的任务,可以说在 ARC-AGI 领域已经接近人类水平。
当然,这种通用性需要付出高昂的成本,目前还谈不上经济可行:你可以花大约 5 美元请一个人解决一道 ARC-AGI 任务——我们知道,因为我们真的这么做过——而人类消耗的能源成本只有几美分。与此同时,o3-preview 在低算力模式下每道任务需要 27 美元。不过,在未来数月乃至数年里,成本效益很可能大幅改善,因此你应该做好准备:这些能力将在相当短的时间内具备与人类工作竞争的实力。
o3 相比 GPT 系列取得的进步证明,架构决定一切。你无法仅仅给 GPT-4 堆更多算力,就得到这样的结果。单纯扩大我们在 2019 至 2023 年所做的事情——沿用相同架构,用更多数据训练一个更大的版本——已经不够了。进一步的进展需要新的思想。
ARC-AGI 是发现这类突破的重要 benchmark。它能够凸显模型的泛化能力,而那些已经饱和或要求较低的 benchmark 做不到这一点。不过,必须强调的是,ARC-AGI 并不是检验 AGI 的决定性测试——今年我们已经重复说明过几十次。它是一种研究工具,旨在让人们将注意力集中到 AI 领域最具挑战、尚未解决的问题上。在过去五年里,它很好地履行了这一职责。
通过 ARC-AGI 并不等同于实现 AGI。事实上,我认为 o3 目前还不是 AGI。o3 仍然会在一些非常简单的任务上失败,这说明它与人类智能之间依然存在根本性差异。
此外,早期数据表明,即将推出的 ARC-AGI-2 benchmark 对 o3 来说依然是一项重大挑战。即使使用高算力配置,o3 的得分也可能降到 30% 以下,而聪明的人类即使未经训练,仍然能够取得 95% 以上的成绩。这证明,我们依旧可以在不依赖专业领域知识的前提下,创造出困难且尚未饱和的 benchmark。如果有一天,再也无法创造出普通人类觉得容易、AI 却觉得困难的任务,你就知道 AGI 真正到来了。
为什么 o3 的得分比 o1 高这么多?又为什么 o1 的得分一开始就远高于 GPT-4o?我认为,这一系列结果为我们持续探索 AGI 提供了极其宝贵的数据点。
在我的思维模型中,LLM 就像一个向量程序仓库。收到 prompt 后,它会找到与你的 prompt 相匹配的程序,然后在当前输入上“执行”它。通过被动接触人类生成的内容,LLM 得以存储数百万个实用的微型程序,并让这些程序能够实际运转。
只要拥有合适的训练数据,这种“记忆、检索、应用”范式就能在任意任务上达到任意水平的技能,但它无法适应新事物,也无法即时掌握新技能——换句话说,其中并不存在流体智力。LLM 在 ARC-AGI 上的低分正体现了这一点。ARC-AGI 是唯一专门用于衡量模型适应新事物能力的 benchmark:GPT-3 得分为 0,GPT-4 接近 0,GPT-4o 也只有 5%。即使把这些模型扩展到现实所能达到的极限,其 ARC-AGI 成绩仍远远比不上几年前最基础的暴力枚举方法——后者最高可以达到 50%。
要适应新事物,你需要两样东西。首先是知识,也就是一组可以调用和复用的函数或程序。LLM 在这方面绰绰有余。其次,当面对新任务时,你需要有能力将这些函数重新组合成一个全新的程序——一个能够对当前任务进行建模的程序。这就是程序合成。长期以来,LLM 一直缺乏这种能力,而 o 系列模型弥补了这一缺陷。
目前,我们只能推测 o3 的具体工作原理。但 o3 的核心机制看起来像是在 Token 空间中搜索并执行自然语言程序:在测试阶段,模型会搜索各种可能的 Chain of Thought(CoT),由它们描述解决任务所需的步骤;这种方式或许与 AlphaZero 风格的蒙特卡洛树搜索并没有太大差别。对于 o3,这一搜索过程大概由某种 evaluator model 引导。值得注意的是,Demis Hassabis 早在 2023 年 6 月的一次采访中就暗示,DeepMind 一直在研究这一思路——这条研究路线其实已经酝酿了很久。
因此,虽然单次生成式 LLM 难以应对新事物,但 o3 会生成并执行自己的程序,从而克服这一问题。在这里,程序本身,也就是 CoT,成了知识重组的产物。尽管这并非测试阶段重组知识的唯一可行方法——还可以进行 test-time training,或者在 latent space 中搜索——但从这些新的 ARC-AGI 成绩来看,它代表了当前最先进的技术水平。
从本质上说,o3 代表了一种由 deep learning 引导的程序搜索。模型会在测试阶段搜索“程序”空间——这里指自然语言程序,也就是描述如何解决当前任务的 CoT 空间——而搜索过程则由 deep learning prior,也就是基础 LLM 引导。解决一道 ARC-AGI 任务之所以最终可能消耗数千万个 Token、花费数千美元,是因为搜索过程必须在程序空间中探索数量庞大的路径,其中还包括回溯。
不过,这里发生的事情,与我之前将“由 deep learning 引导的程序搜索”称为通往 AGI 最佳路径时所指的概念,存在两个重要区别。关键在于,o3 生成的程序是自然语言指令——交由 LLM“执行”——而不是可执行的符号程序。这意味着两件事。第一,这些程序无法通过实际执行并直接接受任务评估来接触现实;相反,它们必须由另一个模型评估适应度。由于缺乏这种现实基础,当系统在分布外运行时,评估结果可能出错。第二,系统无法自主获得生成和评估这些程序的能力——不像 AlphaZero 这样的系统能够自行学会玩一种棋盘游戏。相反,它依赖由专家标注、人类生成的 CoT 数据。
目前还不清楚这个新系统的具体局限是什么,以及它能扩展到什么程度。我们需要通过进一步测试才能找到答案。无论如何,目前的性能已经是一项非凡的成就,也明确证明了:以直觉为引导、在测试阶段搜索程序空间,是构建能够适应任意任务的 AI 系统的一种强大范式。
首先,在 2025 年 ARC Prize 竞赛的推动下,对 o3 进行开源复现,对于推动研究社区前进至关重要。我们需要彻底分析 o3 的优势与局限,才能理解它的扩展规律、潜在瓶颈的性质,并预测进一步发展可能解锁哪些能力。
此外,ARC-AGI-1 现在已经逐渐饱和。除了 o3 的新成绩之外,另一个事实是:由多个低算力 Kaggle 解决方案组成的大型 ensemble,如今在 private eval 上已经能够取得 81%。
我们将通过新版本 ARC-AGI-2 提高门槛。这一版本从 2022 年起便已开始研发,有望对当前最先进水平进行一次重大重置。我们希望它通过困难且信号质量高的 eval,凸显当前 AI 的局限,将 AGI 研究的边界继续向前推进。
我们对 ARC-AGI-2 的早期测试表明,它会非常有用,也极具挑战性,即使对 o3 也是如此。当然,ARC Prize 的目标仍是产出一个高效率且开源的解决方案,以赢得 Grand Prize。目前,我们计划将 ARC-AGI-2 与 ARC Prize 2025 同时发布,预计发布时间为第一季度末。
展望未来,ARC Prize Foundation 将继续创建新的 benchmark,让研究人员把注意力集中到通往 AGI 途中最困难、尚未解决的问题上。我们已经开始开发第三代 benchmark,它将彻底摆脱 2019 年 ARC-AGI 的形式,并融入一些令人兴奋的新想法。
今天,我们还将公开高算力 o3 测试产生的数据,包括结果、尝试记录和 prompt,并希望大家能帮助我们分析这些结果。
我们尤其好奇的是:Public Eval 中约有 9% 的任务,即使投入大量计算资源,o3 仍然无法解决,但这些任务对人类而言却很简单。
o3 能解决和不能解决的任务,分别具有哪些特征?
你会如何量化 o3 无法解决的任务所具有的属性?请不要局限于描述性统计,例如网格大小、颜色数量等。
你能否为任务分配一个“难度分数”?它与 o3 的表现是否相关?
如果让你创建新任务,你会重点设计哪些属性,让任务对 o3 来说更容易或更困难?
我们邀请整个社区帮助评估已解决任务与未解决任务各自具有的特征。
为了帮助大家打开思路,下面给出 3 个高算力 o3 仍未能解决的任务示例。
我们还在 Discord 中创建了一个名为 oai-analysis 的新频道,非常欢迎大家在那里分享分析和洞见。你也可以在 X/Twitter 上通过 @arcprize 联系我们。
总结来说,o3 代表了一次重大飞跃。它在 ARC-AGI 上的表现清楚展现了适应能力和泛化能力的真正突破,而其他任何 benchmark 都无法如此明确地揭示这一点。
o3 修复了 LLM 范式的一项根本局限——无法在测试阶段重新组合知识——并通过一种由 LLM 引导的自然语言程序搜索实现了这一点。这不仅仅是渐进式进步,而是进入了一个全新的领域,值得严肃的科学研究与关注。
订阅以获取最新动态。