训练数据污染、针对性过拟合、基准榜单通胀等结构性问题导致现有AI评测无法真实反映模型能力,且催生了劣质微调产业链。
Dan Luu 刚刚发表了《The Benchmarkpocalypse》,这是一篇极具冲击力的分析文章,揭示了 AI 基准测试为何从根本上已经崩坏。这个故事在 Hacker News 上获得了 83 点,虽然看起来不算高,但 Luu 的批评影响深远——它挑战了我们评估 AI 模型的整个基础。
以下是这篇文章的主张、它为何重要,以及它对任何基于 AI 基准测试做决策的人意味着什么。
AI 基准测试本应告诉我们哪些模型更好。但正如 Luu 所言,基准测试的生态已经扭曲到这样的程度:基准测试往往用错误的方式测量错误的东西,而且激励机制也是错的。
这些问题根植于结构层面:
污染(Contamination):基准测试泄露进训练数据。当一个基准测试变得流行,模型制造商就会把它加入训练集——无论是有意为之还是因为数据从网上爬取。模型并没有在底层任务上变得更好;它只是在记忆答案。
针对基准测试的过拟合(Overfitting to the benchmark):模型被优化以在特定基准测试上获得高分,而不是真正擅长底层能力。这就是 Goodhart 定律的问题:当一个指标变成目标,它就不再是一个好的指标。
基准测试选择偏差(Benchmark selection bias):受到关注的基准测试都是新模型能展示出改进的那些。那些模型趋于平稳的基准测试被悄悄抛弃,造成了幸存者偏差,使得进展看起来比实际更快。
任务不匹配(Task mismatch):基准测试评测的是容易自动评估的任务(选择题、精确匹配),而不是真正重要的任务(开放式推理、创造性问题解决、现实世界应用)。
这不是一场学术争论。企业、研究人员和开发人员都在基于基准测试做出真实决策:
如果基准测试是坏的,所有这些决策都建立在一个有缺陷的基础上。
以严谨、数据驱动的分析著称的 Luu 提出了几个具体观点:
基准测试测量的是狭窄的能力,而不是通用智能。一个在 MMLU 上获得 95% 的模型并不是"具有人类 95% 的智能"——它只是一个擅长回答 MMLU 所涵盖的特定主题的多选题的模型。
基准测试表现和现实世界表现之间的差距正在扩大。随着模型越来越擅长玩转基准测试,基准测试分数与实际任务表现之间的相关性正在减弱。基准测试上 10 分的提升可能代表着现实世界能力零提升。
基准测试行业有着扭曲的激励机制。基准测试创建者希望他们的基准测试被使用,这意味着他们希望模型展示"有趣"的结果。基准测试用户(模型制造商)希望展示进步。双方都从显示改进的基准测试中获益,即使这种改进是虚假的。
替代评估方法存在但未被充分利用。人类评估、对抗性测试和现实世界部署指标都比基准测试更有意义——但它们昂贵、缓慢,而且难以跨模型比较。
如果你在为应用选择 AI 模型,Luu 的分析建议了一种不同的方法:
不要相信基准测试排行榜。位居榜首的模型可能不是你的特定用例的最佳选择。排行榜测量的是基准测试表现,而不是你的任务表现。
建立你自己的评估。创建一个来自你应用的真实输入测试集,并在此基础上评估模型。不需要很大——50-100 个代表性示例比任何基准测试分数都更能告诉你信息。
针对你的失败模式进行测试。基准测试测试的是平均表现。但对你的应用重要的是最坏情况表现。找到那些会让模型崩溃的输入,并专门针对这些进行测试。
评估总成本,而不仅仅是质量。一个在基准测试上好 5% 但贵 10 倍的模型不一定是正确的选择。将延迟、每次请求成本和可靠性与质量一起考虑。
警惕污染。如果一个模型在一个流行基准测试上得分异常高,检查该基准测试数据是否出现在模型的训练语料库中。许多"突破"只是记忆。
基准测试问题对开源模型尤为突出。当一家公司发布一个基准测试分数令人印象深刻的模型时,该基准测试通常是训练数据的一部分。在独立评估者用留出数据测试模型时,他们经常发现与专有模型的差距远大于基准测试所暗示的。
这并不意味着开源模型没有价值——它们有价值,特别是在隐私、成本和主权方面。但这意味着开源和闭源模型之间的基准测试比较应该持怀疑态度。
Luu 的分析暗示了几项改革:
Dan Luu 的《Benchmarkpocalypse》并不是说 AI 没有在进步——它显然在进步。但它说的是,我们对这种进步的衡量方式存在深层次缺陷,而且随着赌注越来越高,这些缺陷正在变得更糟。
对于开发者来说,实际的结论很简单:不要再相信基准测试排行榜。建立你自己的评估,在你自己的数据上测试,基于真实表现而不是合成分数来做决策。基准测试行业不会自我修复——但你可以通过不把你的判断外包给一个破碎的系统来保护自己。
模型在变得更好。基准测试在变得更糟。知道其中的区别。