OpenAI o1 在 ARC-AGI 基准创新高
o1 推理模型在 ARC-AGI-Pub 基准上取得突破成绩,展示推理型 LLM 在复杂问题求解上的进展。
o1 推理模型在 ARC-AGI-Pub 基准上取得突破成绩,展示推理型 LLM 在复杂问题求解上的进展。
ARC Prize 对 OpenAI 新款 o1 模型的测试与评注
更新:o1 完整版已于 2024 年 12 月 5 日发布,重要更新见此处。
过去 24 小时里,我们获得了 OpenAI 最新发布的 o1-preview 和 o1-mini 模型的使用权限。这些模型经过专门训练,能够模拟推理过程。在给出最终答案之前,它们会获得额外时间来生成并完善 reasoning token。
数百人询问 o1 在 ARC Prize 上表现如何。因此,我们使用评估 Claude 3.5 Sonnet、GPT-4o 和 Gemini 1.5 时采用的同一套基线测试工具,对它进行了测试。结果如下:
o1 是否代表了一种通往 AGI 的新范式?它能否通过扩大规模继续提升?为什么 o1 在 IOI、AIME 等许多基准测试中取得了令人惊叹的成绩,但在 ARC-AGI 上却只有相对一般的分数?
这里有很多值得讨论的内容。
o1 在训练阶段和测试阶段的推理过程中都应用了「让我们一步一步思考」的 chain-of-thought(CoT)范式,将这一范式完整地实现了出来。
在实践中,当一项任务的中间步骤序列在合成 CoT 训练数据中得到了充分体现时,o1 出错的概率会显著降低。
在训练阶段,OpenAI 表示,他们构建了一种新的 reinforcement learning(RL)算法,以及一个利用 CoT、数据效率极高的训练流程。
这意味着,o1 训练的基础来源仍是一组固定的预训练数据。但 OpenAI 还能生成大量模拟人类推理过程的合成 CoT,再通过 RL 对模型进行进一步训练。一个尚未得到解答的问题是:OpenAI 如何选择用哪些生成出来的 CoT 进行训练?
虽然我们掌握的细节不多,但 RL 的 reward signal 很可能来自验证机制(用于数学、代码等形式化领域)和人工标注(用于任务拆解、规划等非形式化领域)。
在推理阶段,OpenAI 表示,他们利用 RL 让 o1 能够打磨自己的 CoT,并改进所采用的策略。我们可以推测,这里的 reward signal 来自某种 actor + critic 系统,类似 OpenAI 此前发表过的方案。同时,他们可能还会在推理阶段对生成的 reasoning token 进行搜索或回溯。
o1 最重要的一点在于,它展示了一个可行的案例:将 CoT 推理搜索应用于非形式化语言,而不仅仅是数学、代码或 Lean 等形式化语言。
虽然利用 CoT 扩展训练阶段的计算规模值得关注,但真正重大的新进展是测试阶段的 scaling。
我们相信,迭代式 CoT 确实能够带来更强的泛化能力。自动化的迭代 re-prompting 使模型能够更好地适应新颖问题,这与 MindsAI 团队采用的测试阶段 fine-tuning 有些类似。
如果只执行一次推理,我们就只能重新应用记忆下来的程序。但如果针对每项任务生成中间 CoT 输出,也就是中间程序,就能够组合已经学会的程序组件,从而实现适应。这项技术是解决大语言模型泛化能力首要问题——适应新颖事物的能力——的一种方式。不过,与测试阶段 fine-tuning 一样,它最终仍然存在局限。
当 AI 系统可以使用可变数量的测试阶段计算资源时——例如不同数量的 reasoning token,或者不同长度的搜索时间——我们就无法再客观地用单一基准分数来描述它,因为得分取决于允许使用的计算量。这正是这张图所展示的内容。
计算量越大,准确率越高。
OpenAI 发布 o1 时,本可以允许开发者指定测试阶段用于完善 CoT 的计算量或时间。但他们选择在测试阶段计算量这条连续曲线上「硬编码」了一个点,并向开发者隐藏了这一实现细节。
由于测试阶段计算量可以变化,我们不能再仅仅比较两个不同 AI 系统的输出来评估它们的相对智能水平,还必须比较它们的计算效率。
虽然 OpenAI 的公告没有公布效率数据,但我们正在进入一个以效率为重点的时期,这一点令人兴奋。效率是 AGI 定义中的关键要素,也正因如此,ARC Prize 才会对获奖方案设置效率上限。
我们的预测是:今后将会看到更多比较准确率与测试阶段计算量的基准测试图表。
在 ARC-AGI 公开评估数据集上,OpenAI o1-preview 和 o1-mini 的表现都优于 GPT-4o。就准确率而言,o1-preview 与 Anthropic 的 Claude 3.5 Sonnet 大致相当,但要取得与 Sonnet 相近的结果,它所需的时间约为后者的 10 倍。
为了获得 ARC-AGI-Pub 排行榜上的模型基线分数,我们使用了测试 GPT-4o 时采用的同一个基线 prompt。当我们测试 o1 这类纯模型并公布结果时,我们的目标是在不叠加任何优化的情况下,尽可能测量基础模型本身的性能。
未来,其他人或许能发现更好的 CoT 风格模型 prompt 方法。如果这些方法得到验证,我们很乐意将其加入排行榜。
o1 的性能提升确实伴随着时间成本。在 400 道公开任务上,它耗费了 70 个小时,而 GPT-4o 和 Claude 3.5 Sonnet 只用了 30 分钟。
你可以使用我们的开源 Kaggle notebook,将其作为基线测试工具,或者作为开发自己方案的起点。公开排行榜上的 SOTA 提交结果,不仅使用了最前沿的模型,还应用了各种巧妙的技术。
也许你能找到一种方法,将 o1 作为基础组件,以类似的方式取得更高分!
在这张图中,OpenAI 展示了 AIME 准确率与测试阶段计算量之间的对数线性关系。换句话说,计算量呈指数增长时,准确率会线性提升。
许多人现在都在问一个新问题:这种方式究竟能扩展到什么程度?
从概念上讲,这种方法唯一的限制是交给 AI 的问题是否可判定。只要搜索过程拥有一个包含正确答案的外部 verifier,准确率就会随着计算量的增加而呈对数增长。
事实上,公布的结果与 Ryan Greenblatt 在 ARC Prize 中采用的一项顶尖方案极为相似。他让 GPT-4o 为每项任务生成 k=2,048 个解题程序,再根据任务中的示例对这些程序进行确定性验证,最终取得了 43% 的分数。
随后,他评估了不同 k 值下准确率的变化。
Ryan 在 ARC-AGI 上发现了完全相同的准确率与测试阶段计算量之间的对数线性关系。
这是否意味着,只要不断扩大测试阶段的计算量,AGI 就已经到来了?还没那么简单。
观察任何复杂度为 O(x^n) 的暴力搜索,都能看到类似的指数 scaling 曲线。事实上,我们知道,ARC-AGI 中至少 50% 的任务可以完全不使用 AI,仅靠暴力搜索解决。
如果想用这种方式攻克 ARC-AGI,每项任务需要生成超过 1 亿个解题程序。仅从实用性考虑,就足以排除在大规模 AI 系统中采用 O(x^n) 搜索的可能性。
更重要的是,我们知道人类并不是这样解决 ARC 任务的。人类不会生成数千个潜在答案,而是利用大脑中的感知网络「看出」少量潜在答案,再通过类似 system 2 的思考方式对其进行确定性检查。
衡量智能,可以观察一个系统在各种情境中将信息转化为行动的能力。它是一种转化率,因此会逐渐逼近某个极限。一旦拥有了完美的智能,想要继续进步,唯一的办法就是收集新的信息。
一个不那么智能的系统,可以通过几种方式让自己看起来更智能,但它实际上并没有变得更智能。
一种方式是直接记住最佳行动。这样的系统会非常脆弱:它可能在某个领域中显得很智能,却很容易在另一个领域中失效。
另一种方式是反复试错。如果一个系统最终能够得到正确答案,它看起来或许很智能;但如果它需要先猜 100 次,情况就不是这样了。
我们可以预期,未来关于测试阶段计算的研究会探索如何更高效地扩展搜索和完善过程,比如利用 deep learning 引导搜索。
尽管如此,我们认为仅凭这一点,仍不足以解释 o1 在 ARC-AGI 与 IOI、AIME 等其他客观上同样困难的基准测试之间为何存在如此巨大的表现差距。
一种更充分的解释是:o1 仍然主要在其预训练数据的分布范围内运作,只是现在这个分布还包含了所有新生成的合成 CoT。
新增的合成 CoT 数据让模型更加关注 CoT 的分布,而不只是答案的分布——也就是说,更多计算资源被花在「如何得到答案」上,而不仅仅是「答案是什么」。我们预计,o1 这类系统会在那些需要复用著名模拟推理模板(程序)的基准测试上表现更好,但面对需要即时合成全新推理过程的问题时,仍然会举步维艰。
测试阶段对 CoT 的完善,只能在一定程度上纠正推理错误。这也解释了为什么 o1 在某些领域中如此惊艳:如果基础模型也以类似方式进行了预训练,测试阶段对 CoT 的完善便会获得额外加成。
单独采用其中任何一种方法,都无法带来如此巨大的飞跃。
总而言之,o1 代表了一次从「记住答案」到「记住推理过程」的范式转变,但它并没有脱离那个更广泛的范式:通过对数据分布进行曲线拟合,让所有内容都落入分布之内,从而提升性能。
要实现 AGI,我们仍然需要新的思路。
深度集成 CoT 是一个令人兴奋的新方向,还有更多内容等待探索。ARC Prize 的存在,就是为了将这种活力引入开源世界,让所有人都能在有生之年受益于开放的 AGI。
对于如何进一步推动这些新思路,你有什么想法?将 CoT 与 multi-modal 结合、将 CoT 与代码生成结合,或者把程序搜索与 CoT 结合,效果又会如何?
现在正是参与 ARC Prize、投身其中的时机。你可以赢得最高分奖金和论文奖项,还能收获数百万人的关注与尊重。
伟大的想法可能来自任何地方。也许就来自你?
你可以从我们的默认 Kaggle notebook 开始,亲自尝试研究 o1。
注册 ARC Prize,即可在排行榜出现新的高分时收到通知。