主流AI基准严重饱和、泄漏且鼓励背诵,无法真实反映模型能力,需要更难的动态测试替代方案。
模型在 MMLU 上得了 90 分。在 GSM8K 上得了 95 分。在 HumanEval 上得了 98 分。新闻稿说:"业界领先。逼近 AGI。"你自己试了试这个模型。它不错。但没那么好。它会在简单任务上犯错。它在推理上吃力。它在训练数据之外的任务上失败。基准测试在撒谎。它们坏了。
这就是标准基准测试的问题。它们已经饱和了。它们存在数据泄露。它们奖励的是记忆能力。它们无法衡量真正的能力。
MMLU(大规模多任务语言理解)是一个多项选择题基准测试。
模型在广泛的主题范围内接受测试。
它必须从四个选项中选出正确答案。
这是一场知识测试。
题目是静态的。
答案是已知的。
模型可以记住它们。
分数已接近天花板。
它已经无法区分模型之间的差异。
MMLU 没有坏。它过时了。它是为更早期的模型设计的。
它需要被更具挑战性的基准测试所取代。
GSM8K 是一个数学文字题基准测试。
模型在小学数学题上接受测试。
它必须逐步解决问题。
这是一场推理测试。
题目是静态的。
答案是已知的。
模型可以记住它们。
分数已接近天花板。
它已经无法区分模型之间的差异。
GSM8K 没有坏。它过时了。它是为更早期的模型设计的。
它需要被更具挑战性的基准测试所取代。
HumanEval 是一个代码生成基准测试。
模型在编程题上接受测试。
它必须生成能通过测试的代码。
这是一场编程能力测试。
题目是静态的。
答案是已知的。
模型可以记住它们。
HumanEval 已经饱和。
分数已接近天花板。
它已经无法区分模型之间的差异。
HumanEval 没有坏。它过时了。它是为更早期的模型设计的。
它需要被更具挑战性的基准测试所取代。
这三个基准测试都有共同的问题。
测试数据在训练数据中。
模型已经见过这些题目。
它不是在测试新材料。
分数太高了。
没有改进空间。
基准测试已经没有用了。
模型可以记住答案。
它只是在检索。
问题不在基准测试本身。在于模型。模型太强了。
基准测试没问题。是模型已经超越了它们。
真正的评估需要新的基准测试。
题目是动态生成的。
模型无法记住它们。
对抗性基准测试:
题目被设计成来欺骗模型。
它们测试模型的极限。
它们暴露弱点。
任务不是选择题。
它们需要生成。
它们测试创造力和推理能力。
真正的评估不是关于基准测试。是关于任务。模型应该在真实世界的任务上接受测试。
任务应该与模型的预期用途相关。
评估的未来是不确定的。
近期(1-3 年):
新的基准测试将被开发出来。
它们将更具挑战性。
它们将更具动态性。
中期(3-7 年):
评估将自动化。
它将是持续的。
长期(7-10 年):
评估将集成到训练中。
它将是一个反馈循环。
未来不是基准测试。是用例。模型应该在其执行真实世界任务的能力上被评估。
评估应该与用户相关。
你是 AI 的消费者。你需要对基准测试保持怀疑。
不要只看分数:
分数不是全部。
自己测试模型。
理解局限性:
基准测试已经过时。
它们无法衡量真正的能力。
要求更好的评估:
要求更透明的评估。
要求更相关的评估。
最后一个基准测试不是一场测试。它是一种选择。
你问:"这个模型有多好?"AI 说:"视情况而定。"你意识到:问题不在于模型。而在于任务。
如果你能设计一个基准测试来测试模型的真正能力,它会是什么样子?为什么?