放弃单纯堆参数,AI推理能力靠「思考时长」扩展,验证/搜索/优化三维度突破数据瓶颈。
过去十年,人工智能的发展叙事一直由一个强大趋势主导:规模(scaling)。从早期的 AlexNet 到驱动 GPT-4 的大型集群,公式似乎很简单——更多数据、更多参数带来更好性能。这一范式被著名的「Scaling Laws」所编纂,表明只需关注预训练阶段投入的计算量,就能预测模型改进。然而,随着行业逼近高质量数据边界和硬件物理极限,一个新的规模维度正在浮现。关键不再是模型有多大,而是它在「开口之前」能思考多久。
这种向「测试时规模(test-time scaling)」的转变,标志着从静态智能向动态推理的转型。模型不再仅依赖训练期间学到的模式,而是在推理时获得计算预算来探索、验证和精炼答案。虽然这一概念因 OpenAI o1 系列等模型的发布而流行,但背后的机制仍然有些不透明。Hariri 等人(2026 年)近期发表的一项综合研究,题为《推理 LLM 中的测试时规模:推理机制、评估与可复现性》,为理解这一新前沿提供了急需的形式化框架。
Hariri 等人论文的核心贡献是将测试时规模形式化为三种不同的结构机制。作者没有将所有「额外计算」视为单一标量预算,而是映射了计算如何在自回归模型的隐式前缀树中进行分配。
这是最常见的机制,通常与思维链(Chain-of-Thought,CoT)提示相关。在这种模式下,模型生成单个 token 序列。计算通过允许模型生成更多 token 来扩展——本质上是让模型「与自己对话」来解决问题。研究人员将其描述为沿单一路径延伸思考过程。虽然简单,但这种方法受限于模型在长序列上保持一致性的能力,以及「幻觉」出一个使整个推理过程脱轨的错误转弯的风险。
当模型遇到困难问题时,好奇心往往战胜坚持。叶级扩展涉及生成多个独立完成(树的「叶子」),然后使用归约机制选出优胜者。常用技术包括「N 选一」采样(使用验证器挑选最佳响应)或「多数投票」(自洽性)。正如 Snell 等人(2024 年)早期研究指出,在这种意义上扩展计算往往比简单使用更大规模的模型更有效——前提是模型至少有 nontrivial 的概率在某些尝试中得出正确答案。它将失败风险分散到许多并行试验中。
这是最复杂、也可能是最强大的机制。前缀级扩展不再在评估前完成响应,而是涉及对部分状态的搜索。这可能包括束搜索(beam search)、蒙特卡洛树搜索(Monte Carlo Tree Search,MCTS)或其他前瞻算法。模型查看多个可能的下一步,评估它们的潜力,然后决定继续哪条路径。这允许提前剪枝「死胡同」,并将 token 更高效地分配到有希望的方向。它本质上将语言模型转变为搜索代理——这一技术源于经典人工智能,如今正通过每一步的深度学习验证器获得新生。
研究人员指出的最紧迫问题之一,是当前的评估指标无法适应这个新时代。在预训练时代,我们测量的是测试集上的「准确率」。在测试时规模时代,「准确率」不再是模型的固定属性,而是推理协议的函数。
如果研究 A 报告使用 100 个样本和多数投票达到 80% 准确率,而研究 B 使用相同 token 预算的单一 MCTS 搜索报告 75% 准确率,我们如何比较它们?Hariri 等人认为,不附带具体推理协议及其相关计算成本(以 FLOPs 或 token 计)的准确率报告毫无意义。他们提出了一种新的「评估档案」,在不同机制下将性能与计算预算进行映射。这让研究人员不仅能看到哪个模型更好,还能看到哪个系统(模型 + 推理算法)在不同资源级别上更高效。
这项研究的意义远超基准测试。它暗示了一个训练与推理边界开始模糊的未来。如果通过让一个较小的 GPT-4 级别模型进行几分钟「思考」,就能在特定任务上达到 GPT-5 级别的性能,我们是否还应该为下一次训练投入数亿美元?
答案可能在于 Snell 等人(2024 年)讨论的「计算最优」策略。他们的研究表明,不同测试时策略的有效性高度依赖于 prompt 的难度。对于简单问题,额外计算是浪费。对于「不可能」的问题(模型基础成功率接近零),无论多少采样都无济于事。「甜区」是中等难度的问题——模型可以通过搜索和验证被引导向成功。
测试时规模代表了 LLM 能力的下一个重大进化。通过将推理视为搜索和推理过程而非简单的序列生成任务,我们正在从现有模型中解锁更高阶的智能。然而,正如 Hariri 等人(2026 年)所阐明的,这要求我们在构建、评估和描述这些系统的方式上进行严谨的转变。我们需要放弃报告静态准确率分数,开始描述在直觉速度与思考深度之间实现最优平衡的「推理系统」。
仅仅「更大」模型的时代正在让位于「更智能」使用计算的时代。无论通过扩展思维链、大规模并行采样还是复杂的树搜索,目标始终不变:确保模型在回答之前,已经完成了艰难的思考。
Hariri, M., et al. (2026). Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility. arXiv:2608.04001
Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314
OpenAI (2024). Learning to Reason with LLMs. openai.com