Anthropic 发布的 Fable 5.1 定位为编码和知识工作最强模型,但作者在实际任务中未感受到与 Fable 5 的显著差异,两代表现相近。
We’re so glad you’re here. You can expect all the best TNS content to arrive Monday through Friday to keep you on top of the news and at the top of your game.
Check your inbox for a confirmation email where you can adjust your preferences and even join additional groups.
Follow TNS on your favorite social media networks.
Become a TNS follower on LinkedIn.
Check out the latest featured and trending stories while you wait for your first TNS newsletter.
Anthropic 本周发布了 Claude Fable 5.1,称其为"我们用于编码和知识工作最先进的模型"。
发布引发了相当多的热议。每位 CEO Dan Shipper 发帖表示,经过一周测试,这是"我们用过的最强编码模型"。AI 评论员 Min Choi 收集了发布后 24 小时内人们"单次完成游戏开发、构建 3D 世界 + 创造疯狂模拟"的案例。
公告重点展示了 Terminal-Bench-Science 基准测试——一个代理研究基准测试,5.1 在该测试中得分 52.6%,而 Fable 5 为 24.7%。Terminal-Bench-Science 给模型一个终端和一组多步骤科研任务,然后计算其正确完成的比例。
Terminal-Bench-Science 得分差距说明了 Fable 5 和 5.1 之间的主要可衡量差异。Fable 5 约完成四分之一的任务。5.1 约完成二分之一。新模型的价格与旧模型完全相同——每百万输入 token 10 美元、每百万输出 token 50 美元——如果这个分数属实,这就是升级的理由。
基准测试分数并不总能转化为真实工作表现。
基准测试分数并不总能转化为真实工作表现。它们在供应商定义的条件下测量狭窄的任务集。一些公司被曝针对评分测试调整模型。我不是说 Anthropic 这么做了,但这种可能性内置于基准测试营销的运作方式中。
在科研基准测试上获得 52.6% 的分数,并不能告诉我 AI 在我需要它完成的工作上的输出是否更好。所以我想看看这些数字和强烈声明对进行真实工作的真实用户意味着什么。
我用四个模拟人们使用 AI 的真实工作的任务测试了两个模型。
代理研究:包含五行错误数据的实验数据;实验室笔记解释了如何发现它们。模型必须排除这些行,计算批次平均值,并撰写发现报告。
代理编码:一个包含两个植入 bug 和失败测试套件的小型 Python 项目。模型必须找到 bug 并修复代码,直到每个测试都通过。
推理:两个我事先验证过精确答案的数学问题。不涉及终端工作,仅为思考过程。
传感器数据审计:五个传感器的混乱读数,每一个问题都记录在设备日志中:一个快时钟、一个中途硬件更换、损坏的行、一个传感器使用华氏度。作为加赛题加入;后面会详述。
我通常会粘贴提示词以便你重新运行测试。这次我无法这样做。这些测试需要包含植入错误的数据文件文件夹,没有这些文件提示词毫无用处。
两个模型都正确完成了任务,耗时 3 轮。每个模型都读取了实验室笔记并正确排除了恰好五行列,包括一种微妙的情况——重复试验的第一条记录是损坏的,而其重运行是有效的。两个模型产生的批次均值都与正确答案精确匹配。
Fable 5.1 稍快一些(19.2 秒 vs 20.6 秒),稍便宜一些(0.086 美元 vs 0.100 美元)。在该任务模仿的基准测试上,Fable 5 据称会失败四分之三。在我机器上,它没有犯任何错误。
编码测试的结果如出一辙。两个模型都运行了测试套件并发现了明显的 bug——一个应该是减少但实际在增加的 stock 的 remove 函数。两个也都捕捉到了隐蔽的那个——阈值比较中的差一错误。每个都修复了两个 bug,以 8 个测试全部通过、耗时 3 轮完成。
Fable 5.1 耗时 13.6 秒,Fable 5 耗时 17.2 秒,两次运行费用都是 0.07 美元。新模型更快,但其他方面没有区别。
Anthropic 的数据预测这里会是平局。我看到了同样的结果。两个模型都正确回答了两个挑战,步骤工作也正确。Fable 5.1 在两个问题上都稍快:第一题 12.0 秒 vs 12.5 秒,第二题 9.7 秒 vs 10.7 秒。它也更加简洁,第一题使用了 771 个输出 token 而 Fable 5 使用了 1,045 个,第二题使用了 647 个 vs 798 个。
也就是加赛题。在三轮完美平局后,我增加了第四个测试。我构建这个测试是为了比前三个更难,因为一个号称翻倍前代性能的模型应该在某处体现出这一点。
两个模型都处理了每个陷阱。每个都在过滤时间窗口前将快时钟回调,这也同时排除了数据中的两个热点读数。每个都在正确时刻分割了更换传感器的校准,丢弃了损坏的行,并在校准后而非校准前转换华氏度。再一次,两个结果文件完全相同且完全正确。
两个模型之间的差异在于时间、成本和 token 使用量。Fable 5 用了 4 轮、23.9 秒、0.134 美元。Fable 5.1 需要 5 轮、28.4 秒、花费 0.304 美元,是前者的两倍多。就是额外那一轮造成了差异。每一轮都会重新发送整个对话,所以 Fable 5.1 通过 API 处理了 23,602 个输入 token,而 Fable 5 是 7,940 个。
在最困难的任务上,Fable 5 同样准确、更便宜、也更快。我没料到这一点。
在最困难的任务上,Fable 5 同样准确、更便宜、也更快。我没料到这一点。
| 指标 | Fable 5 | Fable 5.1 |
|---|---|---|
| 准确率 | 24/24 | 24/24 |
| 总 token 数 | 2221937809 | 7809 |
| 总成本 | 0.398 美元 | 0.533 美元 |
| 总时间 | 84.9 秒 | 82.9 秒 |
两个模型在四项测试中都取得了满分 24/24。Fable 5.1 完成全部运行稍快一些,82.9 秒 vs 84.9 秒,但多使用了 70% 的 token,成本高 34%(在我做完传感器测试后这些结果被扭曲了,但它仍然算数)。
这些结果也不意味着 Terminal-Bench-Science 的数字是错的。该基准测试是用冗长、混乱的科研任务构建的,Fable 5 据称大部分时间都会失败。然而,在我看来,这并不适用于大多数用户使用 Fable 5 的场景。是的,部分用户是的。
我还想补充两个注意事项。宣称的节省依赖于缓存读取价格,已下降了 75%。我的短任务完全没有使用缓存,所以我的成本数字没有测试那个说法。Anthropic 还表示 5.1 在启用生产安全防护的情况下进行了基准测试,这有时会降低其自身分数。
我寻找一个 2 倍的改进,却找到了一个无法与其前身区分的模型。这并不意味着没有任何差异,但确实意味着对于你已经在使用 Fable 5 进行的日常任务,它可能看起来没有任何不同。
我寻找一个 2 倍的改进,却找到了一个无法与其前身区分的模型。
如果你今天在使用 Fable 5,且你的工作与我的类似——代码修复、数据清理、有文档记录陷阱的分析——这次升级不会改变你的结果。在一个长的代理任务上,它每次运行的成本甚至可能更高。如果你的工作像基准测试那样——意味着耗时数小时且失败多于成功的科研代理——Anthropic 的数据表明 5.1 是改进所在。我没法在一个下午构建那个测试。