分析 o3 模型在快速与深度推理间的权衡,评估其对实际应用开发的影响。
OpenAI 今天展示了 o3 模型—这是"推理"模型的进一步发展,也是 o1 的后继者。
我对它在 ARC-AGI-1 基准测试上的改进幅度印象深刻—这是一个据称当前一代 LLM 无法击败的基准。o1 的高分是 32%,而 o3 一举跳到了 88%。Arc Challenge 的作者(奖金 100 万美元用于击败 ARC-AGI)曾自信地表示基于 Transformer 的模型在他们的基准上不会成功—他们对 o1 的表现并不印象深刻。然而,o3 的博客文章态度截然不同,充满了"令人惊讶"、"新颖"和"突破性"这样的措辞。不过,这里有个陷阱—成本非常、非常高:达到 76% 的成本约为 9000 美元,88% 的成本—OpenAI 没有公开(考虑到使用了 172 倍更多计算,可以评估总成本约为 150 万美元)。
o3 让我想起了讨论 LLM 时经常提到的一个类比。无论任务有多复杂,GPT 对每个 token 使用相同数量的计算/时间,就好像它们在从潜意识中流式传输信息,永远不会停下来思考。这类似于人脑中"快速"的系统 1 的运作方式。
快速回顾:《Thinking Fast and Slow》是丹尼尔·卡尼曼 2011 年出版的一本著作。他提出,从功能角度看(基于实证研究),我们的大脑具有 2 个部门(或模式):
系统 1,快速—毫不费力的、自主的、关联的。
系统 2,缓慢—费力的、深思熟虑的、逻辑的。
这两个系统协作运作,塑造了人类的思维过程。我们可以轻而易举地大声朗读一本书,却可能记不住一个字。我们也可以全神贯注地读一本书,在脑海中不断回放场景和图像,跟踪事件和时间线,结果在短时间内就感到疲惫—但这样我们可能会获取新知识。
正如吴恩达曾指出的那样,"尝试打字时不按退格键"—这似乎是个困难的任务,这就是 LLM 的工作方式。
好吧,那就是直到最近它们的工作方式。当 o1(以及后来的 Deepseek R1、QwQ、Gemini 2.0 Flash Thinking)出现时,模型学会了停顿并以类似于"慢速"系统的方式运作。
最近有很多讨论称 LLM 预训练已经进入平台期、训练数据日渐枯竭、AI 发展遇到瓶颈。
我们可能看到 2025 年形成的一个趋势—将推理/思考模型与传统 LLM 结合起来,像慢速和快速思维一样相互连接:规划(慢速)和采取行动(快速),识别(快速)和评估(慢速)等等。
以下是 Aider AI 编码助手的一个最近例子,展示了如何通过将 QwQ 作为架构师,Qwen 2.5 作为编码员(提供 2 步"架构师-编码"模式,允许为每一步选择不同的模型)来提升编码性能。
这是否会成为现实—很难说。存在很多挑战,即使使用了慢速模型,我们最近也没有在这些挑战上取得太多进展。还不清楚 o3 这样的模型对幻觉的容忍度如何。上下文窗口仍然太小。价格在上升...虽然慢速模型在各种"隔离式"评估上达到了新高度,但距离大规模实际应用还很遥远(如自行完成大型项目或担任初级实习生)。此外,快速模型(执行者)似乎在计算机使用方面还没有取得进展,而莫拉维克悖论对于自动化计算机办公员仍然构成挑战。
大约在 o3 发布的同一时间,我获得了 o1-mini 的 API 访问权。我运行了自己的 LLM 象棋评估,模拟象棋游戏,提示模型与随机对手对战。虽然之前的 SOTA 模型甚至无法赢得一场比赛(我假设这个基准和 ARC 评估一样困难)...o1-mini 在 30% 的情况下获胜!现在我不那么怀疑了,毕竟这些模型可能真的具有某种推理能力。
一些评论可能仅对已登录的访客可见。登录以查看所有评论。一些评论已被文章作者隐藏—了解更多。
关于进一步的操作,您可能会考虑屏蔽此人和/或报告滥用。