Anthropic发布Fable 5.1后,文章通过真实预算场景(非官方benchmark)对比两代模型在实际任务中的效果差异。
当 Anthropic 本月发布 Fable 5.1 时,所有宣传都围绕一个基准测试结果展开:Terminal-Bench-Science 分数。
在这个基准测试中,模型获得一个终端界面和一道真实的科研问题,独立解决。Fable 5.1 得分 52.6%,Fable 5 得分 24.7%。按 Anthropic 的评分标准,新模型是旧模型的两倍多。
Anthropic 公布的分数是在大多数用户无法复现的条件下产生的。该基准测试允许每个模型每道题最多 8 小时,而 Anthropic 没有公布其使用的测试框架或预算。当该基准测试的排行榜测试 Fable 5 时,它以最大努力运行 Claude Code,在 210 次尝试中花费了 14,180 美元,平均每次约 67 美元。
大多数用户不会在实验室里使用 Fable,所以我想知道普通用户在这些任务上会得到什么结果。我最近在日常工作中测试了 Fable 5 和 Fable 5.1,发现它们之间的差距远没有基准测试显示的那么大。这让我想用普通用户的方式运行基准测试本身的任务,看看模型实际差异在哪里。
基准测试的 70 道题是公开的,所以我从中抽取了 5 道,每个科学领域各一道,自己运行了两个模型。
Terminal-Bench-Science 有五个类别,每个类别有多道测试。我选择了每类中可以在 Python 环境中运行的一道测试。以下是我的选择:
符号回归(数学)—— 一个包含 100 个变量和一个隐藏在是/否标签后的隐藏公式的数据集。模型必须找到一个适用于从未见过数据的预测器。
Lorenz-96 同化(地球科学)—— 从几个未校准的传感器重建一个混沌大气模型,传感器存在未知时钟偏移。评分基于五个标准全有或全无判定。
反应堆安全控制(工程)—— 为一个化学反应器编写控制器,在不超出温度限制的前提下尽快完成每个批次,涵盖公开和隐藏的故障场景。
觅食认知模型(生命科学)—— 逐次预测 20 只小鼠每只会按下哪个杠杆,基于模型从未见过的会话进行评分。
纳米压痕(物理科学)—— 从原始压痕曲线中提取材料属性,曲线包含漂移、粘附、缺陷和未知针尖形状。
每次运行都使用一个普通终端,我为每个测试设置了 12 美元限额和 60 轮对话上限。完整的十次运行大约花了 12 小时。
这是唯一一个模型通过基准测试隐藏测试的项目。Fable 5.1 工作了 27 轮,发现了隐藏结构,写了一个预测器,在 11.8 分钟后自行停止,生成了 27,088 个输出 token,耗资 1.96 美元,通过了这道测试。
Fable 5 用满了全部 60 轮,花了 53.5 分钟,生成了 39,461 个输出 token,耗资 4.20 美元,未通过。我又运行了第二次 Fable 5 以排除运气因素。它再次用满 60 轮,花了 60 分钟,生成了 60,608 个输出 token,耗资 6.38 美元,仍然未通过。
Lorenz-96 同化
这是最昂贵的一对运行。Fable 5 在 45 轮后达到 12 美元成本上限,此时已运行 97.7 分钟,生成了 92,091 个输出 token,最终花费 12.63 美元。Fable 5.1 用满全部 60 轮,花了 126 分钟,生成了 89,789 个输出 token,耗资 10.70 美元。在公开排行榜上,地球科学也是 Fable 5 得分接近零的领域,两款模型在这里都失败了。
反应堆安全控制
两者都没有写出通过评分者场景的控制器。这次运行产生了最多的输出 token,由 Fable 5.1 生成了 157,710 个。它在 40.9 分钟后达到 60 轮上限,耗资 11.53 美元。Fable 5 在 49 轮后达到成本上限,此时已运行 63.8 分钟,生成了 121,978 个输出 token,耗资 12.04 美元。
觅食认知模型
这是整个测试系列中运行时间最长的一次。Fable 5.1 是唯一一款声明自己完成的模型。它构建了一个模型,用自己的评分循环测试了它,在 43 轮后声明完成,此时已运行 53.5 分钟。它创建了 65,518 个输出 token,耗资 5.65 美元。但官方评分者拒绝了它的结果。
Fable 5 什么都没有声明。它在 60 轮后达到 12 美元上限,此时已运行 139.3 分钟,生成了 62,587 个输出 token,最终花费 12.13 美元。
两者都失败了。两者在大部分运行时间都在读取原始曲线和编写代码来分割它们。没有一个产生评分者接受的结果文件。Fable 5.1 在 29.6 分钟、115,687 个输出 token、耗资 10.91 美元时用尽了轮数。Fable 5 在 48 轮后耗尽资金,此时已运行 34.1 分钟,生成了 114,239 个输出 token,最终花费 12.59 美元。
以下是各项数据的对比结果。
| 指标 | Fable 5 | Fable 5.1 |
|---|---|---|
| 解决的题目数 | 0/5 | 1/5 |
| 输出 token 总数 | 430,356 | 455,792 |
| 总成本 | 53.59 美元 | 40.75 美元 |
| 总时间 | 388 分钟 | 262 分钟 |
| 因成本上限终止的运行次数 | 4 | 0 |
基准测试用三次试验评估所有 70 道题,Anthropic 的 24.7% 和 52.6% 来自完整的测试套件。独立排行榜将 Fable 5 评为 21.4%,接近 Anthropic 的数字。Fable 5.1 尚未出现在独立排行榜上,所以它的 52.6% 是 Anthropic 单独给出的。我的结果,0% 和 20%,低于两者。五个任务是一个小样本。
即使公布的分数完全准确,纯粹靠运气获得这些结果也是可能的,所以这次运行既不能证实也不能否定翻倍的宣称。方向是匹配的,因为新模型确实表现更好。Fable 5.1 解决的那一道题是数学领域的,这也是排行榜上 Fable 5 表现最好的领域。
我不认为普通用户会在 Fable 5 和 Fable 5.1 之间看到太大差异。我只运行了少量测试,所以无法证明或推翻 Anthropic 的基准测试结果。但我所看到的表明,这个差距不会波及普通用户。真正显示出来的一个差异是在账单上。Fable 5.1 失败得更快、更便宜,它从未达到我的成本上限,而 Fable 5 有四次达到了上限。
假设你的工作看起来更像基准测试任务;测试框架和预算与模型本身同样重要。有了专用测试框架、每任务数小时和更大的预算,你可能更接近 Anthropic 公布的数字。