将「推理」拆分为答对多步问题、类推理机制、真正理解三层,指出公开争议多因语义混淆。
争论为何无法解决
"Reasoning"(推理)这个词至少被用于三种不同的主张:系统能够对新颖的多步骤问题产生正确答案;它通过操纵类似于推理结构的内部表示来实现这一点;以及它拥有某种与人类相同的理解力。第一个主张是可衡量的,对于某些领域来说基本已经得到肯定的回答。第二个是关于机制的开放性经验问题。第三个在其当前表述中根本不是一个经验问题。
大多数公开争论都包含这样的情况:一方用第一个主张论证,另一方用第三个主张否定。两者都没有错;他们用同一句话回答了不同的问题。
这个问题不仅仅是学术性的,这就是为什么值得花一个小时而不是耸耸肩。你对此的信念决定了你的推断程度。如果这些系统执行的是某种类似于通用推理的过程,那么一个强有力的基准分数就是你问题性能的证据。如果它们只是在训练分布的邻域内执行复杂的模式补全,那么基准分数只能说明那个基准本身,几乎不能说明其他问题,正确的工程响应是在你自己的输入上测试,并对所有迁移论证保持怀疑。这是一个关于数字能承载多少信息的实际争论,它会影响预算决策。
它们不推理的案例
怀疑论的案例建立在对变化的脆弱性之上——这些变化不会困扰任何理解了问题的人,而且它有真实的结果支撑。
表面敏感性。Mirzadeh 等人的 GSM-Symbolic 研究(2024)从模板生成小学数学问题的变体——相同的结构、不同的名称和数字——报告称同一问题的变体之间准确率存在差异,而稳健的程序不会产生这种差异。GSM-NoOp 条件(添加一个看起来相关但什么都不改变的子句)产生了报告中的大幅下降。
复杂度悬崖。Apple 的《The Illusion of Thinking》(2025)发现,在可控谜题上,准确率在超过某个复杂度阈值后降至接近零,而且模型在接近该阈值时减少了思考努力。论文认为这与通用推理程序不一致,通用推理程序只会花费更长时间。
不真实的推理痕迹。如果所声称的推理不是答案的原因——这是忠实性文献中的发现——那么可见的"推理"就不是推理的证据,无论内部发生了什么。
污染。基准问题及其解决方案在网络上流传。任何令人印象深刻分数的一部分是检索,而分离各部分确实很困难。
它们推理的案例
另一方不仅仅是热情,其最有力的观点是具体的。
在训练后发布的问题上的表现。在模型截止日期之后发布的竞赛问题无法被记忆。在此类集合上的分数低于污染后的分数,但不为零,这是对纯粹检索论点的最直接反驳。
干预有效。在难题上花费更多 token 能提高准确率,而在简单问题上不会,这是有限计算过程应有的方式,而查找不是。检索不会因为你给它更多时间思考而变得更好。
失败是人性化形状的。算术失误、遗漏约束、符号错误、看似合理但错误的弯路。查找表失败时返回空值或不相关的内容;这些系统的失败方式与一个疲劳的人做这道题时的失败方式相同。
怀疑论的结果在其方法上受到争议。对《The Illusion of Thinking》的 2025 年回应认为,若干报告的崩溃与输出 token 限制被触发相吻合,且至少有一个谜题系列包含被计为失败的不可证明可解决的实例。无论你是否接受这一反驳,它说明了这个争论有多少取决于实验设计而不是模型行为。
一个可以测试的定义
用一个你可以衡量的属性来替换这个词:性能在保留问题的扰动下存活。这是可检查的,它是你从生产系统中真正需要的,而且它不需要任何人同意什么是理解。
For each item in your eval set, produce four variants:
rename swap entity names, keep the structure
renumber change the numbers, recompute the expected answer
reorder permute independent clauses and answer options
distract add a true but irrelevant sentence
Score all four. Report the WORST, not the mean.
worst / original > 0.9 robust on this task
~ 0.7 usable with a verifier
< 0.5 the original score was measuring
something other than the task
这个比率是需要牢记的数字。它将一个无法解决的哲学问题转化为每个任务的测量,并且它能够预测基准分数是否会在与你的输入接触后存活。跑一次这个测试,抽象的争论就不再是决策的承重结构。
工程实践的后续结论
无论你认为哪个阵营更有说服力,操作层面的结论都是相同的,这本身就很有信息量。
在正确性重要的地方验证输出,因为两个阵营都没有声称可靠性。在你自己数据的扰动版本上测试,因为基准数字是污染最严重且最不具代表性的测量。预期问题随规模增长而退化,找到你自己的悬崖而不是假设它在你范围之外。将可见的推理痕迹视为调试辅助而不是论证依据。
合理的立场,也是大多数从业者汇聚的立场,是这些系统执行了一种真正的计算,这种计算真正有用但真正不像演绎——在权重已经几乎知道的范围内强大,而在之外则急剧受限。这不是为了礼貌而做出的妥协。这是双向证据实际支持的,也是足以在其上构建的。
对工程实践的后续结论
无论你更相信哪一方,操作层面的结论都是一样的,这也说明了问题所在。
在正确性重要的地方验证输出,因为两个阵营都不声称有可靠性。在你自己数据的扰动版本上测试,因为基准数字是最被污染、最不具代表性的测量。随着问题规模增大,预期性能下降,找到你自己的临界点而不是假设它超出你的范围。将可见的推理过程当作调试辅助,而不是当作某种论证依据。
合理的立场——也是大多数实践者最终汇聚的立场——是这些系统进行了一种真实的计算,这种计算真实有用但真实地不同于演绎推理——在权重已近乎知晓的范围内强大,在之外则急剧受限。这不是为了客气而做出的妥协。这是双向证据实际所支持的,也足够我们在其上构建。