AI能力呈现非连续性分布——能通过司法考试却分不清9.11和9.9的大小。研究者将此称为「参差不齐前沿」,意味着AI在看似同等难度的任务上可能表现截然不同,程序员不应假设AI能力是平滑可预测的。
能通过律师资格考试的 AI,却会自信满满地坚持认为 9.11 比 9.9 大。这不是正在被修复的 bug——这是 AI 能力的基本形态,研究者称之为「参差不齐的边界」(jagged frontier)。
我们期待智能是平滑的:如果某个事物足够聪明来完成困难任务,那它肯定也能处理简单的任务。AI 完全打破了这个假设,而理解这个断裂是实际使用这些工具时最有价值的一件事。
对人类而言,能力是一个合理的预测指标——一个能写法律文书的人也肯定会数数。对 AI 而言,能力是参差不齐的。它在某些真正困难的任务上展现出超人类的流利度,却在儿童认为 trivial 的事情上失败,而且在这两种情况下都没有任何预警,表现得同样自信。
研究者将这种现象命名为「参差不齐的边界」:AI 能力的边界不是一条平滑的线,而是一条参差不齐的边缘,在卓越的巅峰旁边就是令人惊讶的能力低谷。两个对你来说看起来同样困难的任务,可能分属这条边界的两侧。
一旦你知道往哪里看,失败就不是随机的。一个无法比较 9.11 和 9.9 的模型,不是在推理数量——而是在对文本进行模式匹配,如果你见过很多版本号和日期,「9.11 > 9.9」看起来就是合理的。它从未做过算术运算;它预测的是看起来可能的文本。它在数字母或数字方面的弱点,源于它处理的是分块化的 token,而不是单个字符。低谷恰好对应那些需要精确符号操作而非流利模式补全的任务——这个区别在我的文章中有更深入的探讨。
一旦你接受了这个形态,你的整个方法都会改变:
永远不要假设能力会迁移。「它搞定了那个困难的事,所以我可以信任它处理这个简单的事」——这恰恰是错误的推断。按任务验证,而非按印象验证。
自信不是信号。 模型在正确和灾难性错误时听起来同样确定。它的语气无法告诉你,你正站在边界的哪一侧。
在巅峰处使用它,在低谷处防范它。 依靠它进行流利的、生成式的、模式丰富的工作;对于任何需要精确计算、数数或严谨逻辑的事情,把它放到检查之下。
从 AI 获得最多的人,不是那些最信任它或最不信任它的人——而是那些已经绘制出其参差不齐边缘、知道给定任务落在边界哪一侧的人。
参差不齐的边界提醒我们,AI 不是人类智能的缩小版——它是另一种智能,在陌生的地方既有卓越也有盲目。如果你像对待人一样对待它,它的失败会让你措手不及。如果你把它当作它真正所是的东西——一把参差不齐的、强大的、不平衡的工具——你就能在它可靠的地方依赖它。
更多关于我如何推理 AI 真实能力的内容,请访问 www.divyakush.com。
Tokenization:为什么 LLM 无法数出 strawberry 中 R 的个数——许多低谷背后的机制。