Quanta 杂志深度探讨推理模型的本质,质疑其是否真正推理还是高级统计模式的副产品。

Celsius Pictor for Quanta Magazine

Celsius Pictor for Quanta Magazine

我就直说了:AI"推理"到底在搞什么?
对加引号表示歉意。这种标点符号的调侃在 2024 年更常见,当时那些被称为"大规模推理模型"(LRM)的经过特殊训练的 LLM 表亲还是新生事物。不过现在这样做似乎有点刻薄,特别是考虑到 OpenAI 的一个"通用推理模型"在 2026 年 5 月一次性解决了一个著名的开放数学研究问题。不过,我仍然不确定如何更好地表达我对这些 AI 系统实际在做什么的科学解释所感到的观点冲击。
推理有很多在技术上有定义的形式,但基本过程很容易识别:通过将逻辑相连的中间步骤链接在一起来得出合理的结论。我们用思想做这件事;LRM 使用所谓的思维链,这是一个术语,指的是模型在得出复杂查询答案之前发出的合成文本流。一分钟前,AI 可以通过这些链进行推理的想法还被著名而可信地批评(由苹果公司的研究人员团队提出)为"思维的假象",在令人惊讶的简单条件下可能导致"完全准确性崩溃"。下一分钟,LRM 就在国际数学奥林匹克竞赛中获得了金牌,这是一个如此具有挑战性的壮举,以至于"即使是非常成功的数学家和科学家也可能在他们的简历中强调一生",正如科学家和 AI 评论家 Gary Marcus 和 Ernest Davis 在 2025 年所写的那样。如果这不是"真实"推理的标志,那什么是呢?
但等等——不久之后,来自圣塔菲研究所的更多研究表明,LRM 可以仅通过"表面级'捷径'"就能击败精心设计的推理基准(比如一套类似类比的视觉谜题)。他们所做的看起来不像可推广的推理,而是在欺骗系统。然后,就像接到了提示一样,又来了一个"看我的"时刻:Google DeepMind 和数学家 Terence Tao(GOAT!)用 AI 重新发现或改进了 67 个问题的解决方案,"涵盖数学分析、组合数学、几何和数论"。接受现实吧,各位批评者!
那关于 LRM 不能可靠推理的更多证据呢,即使它们拥有必要的算法和计算预算,并且遭受一长串有科学记录的故障状态(足够长到可以用作滑水道)?随便吧——我想这对你来说就是"参差不齐的智能"罢了(AI 行话表示"当它起作用时,它就起作用")。
就这样从 2025 年底一直进入 2026 年。我做了 20 年的科学记者,其中一半时间是 AI 记者,所以我知道不要指望快速发展的研究能保持整洁的一致性。但即使对我来说,这种来回摇摆也有点过分了。引用 Al Pacino 在《局内人》中的台词:"我有两种感受:非常生气,还有好奇。"我不认为这里有欺诈行为。我只是想知道方向在哪。AI 推理怎么可能既是胡说八道又不是胡说八道呢?如果是这样,它到底是怎么运作的?
我知道首先要联系谁。
Melanie Mitchell 在 AI 领域的职业生涯可以追溯到 20 世纪 80 年代,但最近她获得了当代 AI 真理诉说者的声誉,为《Science》和她广泛阅读的通讯撰写清晰的解释文章,同时也在圣塔菲研究所进行研究。(关于"表面级'捷径'"的研究正是她的。)当我问她我们对 AI 推理实际上了解什么时,她的答案简洁到足以写在一张索引卡上。
"第一:它有效。它改进了事物,"她说,指的是 LRM 相比 LLM 在推理任务上的优越准确性。"第二:生成的实际文本"——即每个 LRM 被训练来产生的用于改进其性能的思维链——"不一定忠实于模型内部发生的事情。第三:很多文本甚至没有用处。你实际上可以把它去掉。"
让我们来解析第二和第三点,因为那正是"胡说八道和不胡说八道"叠加态实际存在的地方。思维链在 2022 年被半发现、半发明为 LLM 的提示技巧:为它们提供写好的推理示例(或者说,在著名的例子中,只需要求他们"一步步思考"),他们突然会对简单的逻辑和数学问题给出更聪明的答案。从 OpenAI 在 2024 年的 o1 模型开始的 LRM,被训练来通过生成这样的提示——也称为推理痕迹或思考令牌——然后将其反馈给自己来自动化这个技巧。因为 LRM 本质上只是语言模型,那些额外的文本片段创建了看起来令人信服的模型"思维过程"的证迹。
除了这一点都不简单。越来越多的学术和产业研究对这些"中间令牌"是否忠实代表 LRM 内部工作原理提出了质疑。亚利桑那州立大学研究人员 Subbarao Kambhampati 称之为"喃喃自语"——这不是可审计的凭证或准确的报告,而是语言片段,但其含义可能完全与可能发生的任何推理无关。Kambhampati 的实验室在 2025 年表明,完全用不正确或无关的"痕迹"替换模型的正确"痕迹"并不会降低其在形式推理任务上的性能。同时,仅用正确痕迹数据训练模型仍然导致它偶尔生成其推理的无效记录——即使它为给定的原始问题产生了正确的解决方案。纽约大学研究人员在 2024 年的一篇论文表明"无意义填充令牌"——字面上是点的字符串——可以有效地替代人类可读的"思维链"。
该论文的作者之一、现任芝加哥丰田工业大学教授的 William Merrill 直言不讳地说:"不能保证思维链在任何意义上都必须是有意义的。"纽约大学研究人员 Pavel Izmailov(他也为 Anthropic 工作,曾是其原始推理模型团队的一部分)表示,他怀疑强化学习——LRM 的典型训练方法——甚至是否能激励模型首先就产生忠实的思维链。"我是说,也许它会,"他对我说。"但我会说概率不是很高。"
好的,所以推理痕迹的语言内容可能是可疑的。但令牌本身肯定必须在产生模型输出中起作用吧?(想象一台弹球机:它靠硬币运行,不是靠"我们相信上帝"这些字。)
没那么快。东北大学和加州大学伯克利分校在 2025 年的一篇论文研究前沿开源 LRM,表明他们的"思考步骤"中 30% 到 60% 对模型对基准数学问题产生的答案具有"最小因果影响"。去掉一半,模型的性能几乎不受影响。"当我们审查这些思维链提示时,我们想要谨慎行动,因为它们可能不与最终输出相关,"该研究的作者之一 Weiyan Shi 说。
所以,那些本来应该将 LRM 与纯粹的逐字预测 LLM 区分开来的推理痕迹,不一定对模型的……推理既有意义又有因果关系?我不是哲学家,但这似乎拉伸了"推理"含义的极限。Kambhampati 的研究小组在他们关于该主题的立场论文标题中听起来坦率地厌倦了(在 2026 年国际机器学习会议上发表,该领域最有声望的学术聚会之一):"停止将中间令牌拟人化为推理/思维痕迹!"
需要说明的是,Kambhampati 是人工智能促进协会的前任主席,具有 AI 规划算法的背景,他不否认 LRM 可以起作用(当它们起作用时)。"我们处于奇妙的时代,"当我问他对 OpenAI 2026 年解决数学中著名的单位距离问题的胜利有什么看法时,他对我说。如果他有意见要提,那就是他认为学术界和工业界都在匆忙接受过于便利的解释。
"许多关于这些模型力量来源的观点都被误解或曲解了,"他说。"有一种普遍的心态认为,'我们不妨声称某些能力,因为最终这可能真的会成为现实。'而我的看法是:这不是科学。这是投资。"
在 AI 推理阵营的另一方,不屑似乎是相互的。"那些去年夏天发表的'科学'论文——我会用很大很大的引号,"OpenAI 技术人员、同时也是公司推理模型在科学家和数学家中杰出倡导者的 Sébastien Bubeck 说。他称苹果之前批评 AI 推理的研究结果是"错的",声称这些是由于现已过时的模型中的训练怪癖造成的。"从 GPT-5.5 开始的现代模型不存在这个问题,"他说。"重新审视那些结果会很有趣。"(苹果没有让其研究人员接受采访。)
事实是:没有人否认 AI 推理模型确实可以产生重要和准确的结果。此外,我交流过的每位研究人员都承认,关于模型在某些推理任务(尤其是较小的开源 LRM)能力的负面发现,可能不一定能推广到最新的 AI 产品。它们的内部机制仍然是商业秘密。但如果我们(如我)不倾向于简单地驳斥关于驱动 AI 推理的机制的矛盾证据,问题仍然存在:我们如何看待这些矛盾呢?
事实证明,Kambhampati 正是对此感兴趣。"我不是消极的。我听起来消极只是因为其他人都太积极了,"他说。"在科学中,你必须真正理解当前事物的功能和它不能做什么。"
他告诉我(Mitchell 也呼应了这一点),最先进的 LRM 之所以有效,一个直接的原因是,它们通常被围绕着指导和验证其输出的"普通"软件包围。自 2025 年秋季以来改变软件工程的智能体 AI 系统就是这样工作的。谷歌 DeepMind 的 AlphaProof Nexus 也是如此,它依赖 Lean,一个自动定理证明工具。但 Kambhampati 更感兴趣的是理解仅依靠自生成推理轨迹的独立推理模型——"'思考'部分,"他说。
"思考"部分正是 OpenAI 正在加倍投入的东西。当我问 Bubeck 那个引人注目的单位距离证明是否是用 LRM 自身链式思考之外的方法生成的——也许用 Lean 来验证其结果——他似乎觉得这个问题几乎是无意义的。
"这不像是我们在隐瞒什么,"他说。"我们已经发布了链式思考。你可以去看看。整个要点是模型像人类一样进行推理。而当人类推理时,我们不使用 Lean。"严格来说,OpenAI 发布的是模型链式思考的"改写总结",这是由两位人类专家用另一个 OpenAI 模型 Codex 生成的。自 2024 年以来,该公司没有公开发布其推理模型的"原始"链式思考,这也是谷歌 DeepMind 和 Anthropic 采用的政策。
Kambhampati 的分析从一个惊人相似的地方开始:认为 LRM 只是经过更具体训练的 LLM。"没有额外的魔法,"他说。但他从那里有了明显的偏离。"对我来说,LLM 在给出解决方案之前实际上会做一个关于它在[推理]什么的逐步描述是没有意义的——因为考虑到 LLM 的训练方式,这是一项比仅仅猜测解决方案更复杂的任务。"
他的工作假设是,LRM 像其 LLM 前辈一样,在其庞大的训练语料库中执行他称之为"近似检索"的操作:"在模式匹配和推理之间的某处,"他说,"但更接近前者。"因此,"思考令牌"的角色不是叙述一个真实存在的链式思考(因为根本没有)。相反,它是以使模型更可能预测或"近似检索"看起来像推理的文本字符串的方式来加载模型的上下文窗口。
Kambhampati 将这个过程比作自言自语来刺激记忆:只要能够激发出有用的东西,具体是什么词汇几乎无关紧要(尽管相关的词可能会有帮助)。LRM 的庞大"记忆"包括所有它训练过的类似问答的书面推理示例,这些示例被转换成数值"嵌入",这些嵌入将它们的相似性和差异性(加上其他不可思议的关联)编码为高维空间中的几何关系。在该空间中概率性地得出答案可能涉及中间令牌,其嵌入映射到普通英文中看起来连贯的"想法",但不一定。它们可能是其他语言的片段。它们可能是假感叹词,如"啊哈"。在某些条件下,它们甚至可能只是点。
"无论[嵌入]是否真的对应单个单词"——更不用说是否对应忠实的推理过程——"都不是重点,"Kambhampati 说。
这种框架可以帮助解释一些链式思考的奇怪"虚伪性",以及它们如何能够引发准确的输出。它也能够很好地解释 LRM 在编码和数学中的稳定改进——AI 研究人员称之为"可验证的领域"。代码运行或不运行;证明要么正确要么不正确。这些二元条件和与之关联的书面步骤可以为 LRM 创建方便的训练信号。Kambhampati 说,模型不必学习或可靠地应用通用推理过程;它只需要吸收足够的关于步骤看起来像什么的示例,以在"拼凑"一个可以验证的似是而非的结果过程中预测性地模仿它们。
Kambhampati 补充说,推理模型的训练和步骤遵循能力的限制被称为"推理地平线",这正是苹果研究人员在 2025 年的"思考的幻觉"论文中所暴露的。较新的模型似乎已经推进了这个地平线,尽管不均匀。"大多数时候他们可能没有学习与推理过程相关的算法,"他说。更有可能的是,他们在利用一个不断扩大的示例集合和巧妙的奖励信号。
Kambhampati 远未认为他的论证已经结束,我也不认为。但这是一个开始——而且考虑到其他研究人员也使用过类似的"是训练,傻瓜"的方法来揭开 AI 行为的神秘面纱,我认为这是可信的。尽管如此,房间里仍然有一只大象:我们能否准确观察、描述和验证大型推理模型内部运作过程,到底有多重要呢?
据 Mitchell 所言,诚实的答案是这取决于。"想想 AlphaFold,"她说,指的是谷歌用于预测蛋白质结构的 AI 工具。"它在进行某种难以置信的复杂的统计关联。我们不知道它们是什么,但它们似乎可行。即使没有'推理轨迹',这些东西[已经]是黑盒子。"如果 LRM 能像 AlphaFold 为计算生物学所做的那样加速数学研究,这种思维方式认为,为什么不接受它们,连同它们的特异性,仅仅验证结果呢?"我的观点是:我们想要变得有用。我们想要构建这些模型,以便它们能够解决重要的问题,这样我们就能真正加速科学研究,"Bubeck 说。"比起讨论'哦,但他们只能做到这一点,因为 X [理由]',讨论它们能做什么更有趣也更富有成效。"
但正如 Mitchell 也指出的那样,LRM 可能是"正确答案,错误的理由"的可能性与未来的研究有明显的关系。"你想要正确的答案来自正确的理由,这样你才能信任这些东西,"她说,而不仅仅是在可验证的领域。
NYU 和谷歌的研究人员 Tal Linzen,其计算和心理语言学实验室发布了与苹果"思考的幻觉"论文相似的结果,说"你想要一个 AI 系统能够可靠地应用一个算法,无论你是否称[它]为推理。"即使结果是可验证的,过分尊重链式思考也可能阻止科学家发现更好的方式来引导 LRM 走向准确的输出。"我们可能留下了未曾探索的机会,"Allen Institute for Artificial Intelligence 帮助训练开源 LRM 的研究人员 Pradeep Dasigi 说。不出所料,Kambhampati 用更强烈的措辞表达了这一点:认真对待 AI 推理轨迹的含义,他说,是一个科学"兔子洞",类似于相信地心说或以太学说。
或许话说得有些重,但他确实说到了点子上。那些错误的心智模型在当时看来很符合直觉,就像如今的思维链一样。当一个 LRM 给出正确答案,同时附上数页“思考”来展示它如何得出结果时,直觉会告诉我们,两者必然存在关联。我们很难想象,这一过程与结果之间可能几乎毫无关系。但在 20 世纪 90 年代(Mitchell 和 Izmailov 都提到过这一例子),人们很难想象暴力搜索怎么可能在国际象棋中击败世界冠军 Garry Kasparov。到了 2023 年,人们同样难以凭直觉理解,一大堆矩阵乘法怎么能够写出抑扬格五音步诗。对我们大多数人来说,这些想法根本无法想象。直到突然之间,它们成为了现实。
2024 年夏天,就在第一个 LRM 出现前几个月,Mitchell 向我介绍了一个概念,此后我在报道 AI 时不断回想起它:“一厢情愿的助记符”(wishful mnemonics)。这个说法最早可以追溯到 1976 年,由计算机科学家 Drew McDermott 在一篇标题火药味十足的论文《人工智能遭遇自然愚蠢》(Artificial Intelligence Meets Natural Stupidity)中提出。下面引用的,正是 Mitchell 当时引用的那段话:
AI 程序之所以显得头脑简单,一个主要原因是人们使用“UNDERSTAND”或“GOAL”之类的助记符来指代程序和数据结构。……如果一名研究人员……把自己程序的主循环称为“UNDERSTAND”,那么在证明自己无辜之前,他只不过是在预设结论。他可能误导许多人,其中受误导最深的就是他自己。……他真正应该做的,是把这个主循环称为“G0034”,然后看看自己能否说服自己或其他任何人相信,G0034 实现了理解的某个部分。……一旦明白了问题所在,脑海中就会浮现出许多 AI 研究人员使用一厢情愿的助记符、颇具启发性的例子。
我正是这样理解 AI 推理的。LRM、思维链、思考 token:层层深入,尽是“一厢情愿的助记符”——它们是简写方式与暂时搁置怀疑的迷人混合体,就像 Oprah 式的“显化”,只不过披上了计算机科学的外衣。这未必是在贬低它;所有新颖的研究很可能都需要某种形式的这种心态,才能真正起步。当然,这也并不意味着 AI 推理无法工作,或实际上没有发挥作用。但“一厢情愿”的那部分,似乎仍和以往一样强大。
“我们对语言的反应非常容易拟人化。我们人类就是这样运作的,”Mitchell 告诉我。她说,围绕 AI 推理展开的许多争议性研究活动,“都是意料之中的。但从其他方面来看,其中也存在很多非常不科学的成分。”或者用 Kambhampati 的话说:“虚假的理论,比承认我们没有理论更加糟糕。”
无论如何,在弄清楚它究竟是什么之前,我们总得先给它一个称呼。我不认为自己会一直在提到 AI“推理”时比画空气引号,就像我不会在“马力”的“马”字两边加上引号一样。LRM 就像发动机:它们需要燃料、排放废气,而且速度很快。尽管如此,当我描述踩下油门时自己的 Toyota 能爆发出多大动力,我并不是因为相信引擎盖下面有一群小马蹄正在奋力奔驰。在科学界对 AI 推理模型内部究竟发生了什么给出更清晰的解释之前,我也会以类似的态度看待它们的马力——即使引擎已经轰鸣作响。
同属计算机科学栏目
一位旅行商问题大师走出了自己的道路
研究人员揭示“量子证明”的力量
化学关键问题得到解答,无须量子计算机