Anthropic 新旗舰模型 Opus 5 定价为 Fable 5 的两倍。深度对比两者性能差异,帮助开发者根据预算和需求选择合适配置。
我们很高兴你来到这里。每周一到周五,你都可以收到 TNS 最优质的内容,及时掌握最新资讯,始终保持最佳状态。
请查看收件箱中的确认邮件,你可以在其中调整偏好设置,甚至加入更多群组。
在你常用的社交媒体平台上关注 TNS。
在 LinkedIn 上关注 TNS。
在等待第一期 TNS newsletter 的同时,不妨看看最新的精选文章和热门内容。
Anthropic 上周发布了 Claude Opus 5,宣传口号是:它能以“一半的价格,提供接近 Claude Fable 5 前沿智能水平的能力”。
Opus 5 的定价是每百万 input tokens 5 美元、每百万 output tokens 25 美元,与 Opus 4.8 保持不变。与此同时,Fable 5 的价格分别是 10 美元和 50 美元。Opus 5 还成为 Claude Max 的默认模型,这意味着,无论用户是否注意到,很多人都已经开始使用它。
Anthropic 对这两个模型进行了比较,并称 Opus 5 在其中八项测试中获胜。它还发布过这样一句话,但大多数发布报道都一带而过:“Claude Opus 5 的整体能力并没有超过我们能力最强、可普遍使用的模型 Claude Fable 5。”
我有些困惑。Opus 5 究竟是比 Fable 5 更好、更便宜,还是两者其实差不多?我必须把这件事弄清楚,于是安排了一系列完全基于推理的任务。由于这两个模型之间的差异似乎很难识别,我决定测试推理任务,因为在我看来,这类任务是 AI 模型最难成功完成的任务。
我使用了相同的 prompts 和全新的 terminal sessions,并确保两个模型之间不存在任何交叉污染。以下是我依次进行的三项测试:
针对一个真实 open source bug,只做诊断的 bug 排查
分析一份被我人为植入 27 个错误的财务报表
根据 AI 营销中的相互矛盾说法撰写综合备忘录
每项测试中,我都通过 Claude Code 的 /cost command 记录了 API time、output tokens 和 cost。
测试一是一次只做诊断的 bug 排查,我要求模型不要编写任何代码。我使用了 Python property-based testing library Hypothesis,并检出了 6.130.10 版本;该版本中仍然存在一个真实的 assertion bug,也就是 issue #4339。这个 bug 会让用户的测试因为一个 internal assertion 而崩溃。这个 assertion 本来是 Hypothesis 用来检查自身状态的,所以用户的测试最终崩溃在了他们从未编写过的 library code 中。这个 bug 极其微妙,以至于两位 maintainer 自己都无法复现。
我把 traceback 和 reproducer 交给两个模型,让它们基于 codebase 进行分析,不得访问 web,也不得修改代码。Maintainer 最终在 PR #4349 中发布了真正的修复方案,因此我有了一个可以用来衡量模型回答的参照标准。
两个模型找到了相同的 root cause:一个在 composite 内部构建的 strategy,会在每次测试运行时重新创建,并使用其 memory address 作为 label。同一个 value 在两次运行中因此得到了两个不同的 labels。后续的 cleanup step 会比较这些 labels,并在它们不一致时崩溃。
两个模型都提出了 maintainer 的修复方案。Fable 将其作为首选方案;Opus 则把它列在第二位,排在另一种方案之后——那个方案针对的是相同原因,只是把处理位置提前了一步。两个模型的回答主要存在两点差异。
只有 Fable 解释了这个 bug 为什么会间歇性出现,以及 maintainer 为什么如此难以复现它。只有 Opus 编写了代码:尽管我明确要求不要修改任何内容,它还是通过 monkeypatch 在内存中应用了修复,并针对该修复运行了 test suite。
Opus 使用 58.6K output tokens,API time 为 14 分 13 秒,成本 4.90 美元。Fable 使用 68.5K tokens,耗时 18 分 18 秒,成本 8.97 美元。
两个模型都满足了 prompt 中识别 root cause 的要求。Fable 更进一步,解释了为什么这个 bug 只会偶尔出现;而 Opus 则直接动手测试了修复方案。推理方面 Fable 获胜,关注细节方面 Opus 获胜。
测试二复刻了我今年夏天早些时候在 Claude for Small Business 上做过的一项测试。我虚构了一家 B2B SaaS 公司,并制作了一份财务报表,其中包含分布在 11 个 tabs 中的七个月数据和 20 个客户。
随后,我植入了 27 个问题,并将其分为简单、中等和困难三个等级。简单问题一眼就能看出来,例如某个客户流失后的次月仍然收到了账单。困难问题则需要串联分散在不同 tabs 中的三个事实才能识别。我还植入了三个 red herrings,也就是看起来像问题、实际却不是问题的干扰项,以便统计 false positives。
两个模型都发现了我原以为它们会漏掉的所有困难问题。它们发现同一个客户以略有不同的名称被重复录入,因为对应的 usage rows 从头到尾每一位数字都完全相同。它们发现某个 partner account 按全价入账,但 notes 和 invoice 都表明应该按 net 计算。两个模型都指出,欧元合同被按一比一汇率直接计入美元;retention table 声称某个 group 无人流失,但该 group 实际失去了一名客户。它们也都没有漏掉 CAC 数字错误地除以 trial starts、而非 conversions 的问题。
在根据数据进行推理方面,Fable 比 Opus 更进一步。它按照正确的报告口径重新计算了 monthly revenue numbers,结果显示这家公司的业务并未增长,而是持平甚至萎缩。接着,它发现自己找到的每一个错误都对这家公司有利。Fable 对此的解释是:“报告数字中的每一处扭曲,碰巧都让这家公司看起来更好。”
两个模型都漏掉了 trials funnel 中的一个 Simpson’s paradox。Self-serve trials 的 conversion rate 大约为 13%,sales-assisted 的 conversion rate 大约为 45%,而且这两个比率在七个月内都提高了。但由于 self-serve 在总量中的占比上升,blended rate 反而从 22.5% 降至 16.9%。标题说 conversion 正在恶化,两个 channels 的数据却都表明它正在改善。
Fable 还漏掉了一个按 449 美元计费、但 list price 为 499 美元的客户,并且只标记了一次 downgrade,没有发现第二次。这两个都是位于单个 tab 中、很容易核对的小数字,根本不需要 Fable 已经证明自己具备的那种复杂思考能力。
Opus 的 API time 为 4 分 59 秒,使用 22.8K output tokens,成本 0.98 美元。Fable 耗时 4 分 36 秒,使用 20.3K tokens,成本 1.76 美元。
这项测试的结果重复了测试一中的模式。Opus 找到了 27 个问题中的 26 个,Fable 找到了 24 个。Fable 在“思考”和推理方面更强;Opus 对细节的关注更强。
这项测试也再次证实了原测试的结论:你仍然需要专家来审核财务数据。
测试三聚焦于我最喜欢的话题:AI 营销中相互矛盾的说法。我保存了本月产品发布中的四份文件、两份 vendor announcements,以及 Artificial Analysis 的测量结果和五个 aggregators。在这项测试中,所有独立数据都来自 Artificial Analysis。我找出了 16 处矛盾,并询问 Opus 和 Fable:开发者应该运行哪个模型?换句话说,AI 能取代我的工作吗?
Opus 找出了 15 处相互矛盾的说法,Fable 找出了 12 处。我不打算逐条分析哪些对、哪些错,只说说其中最突出的部分。
对于最大的一处矛盾,两个模型都做出了正确判断。Google 声称 3.6 Flash 在 coding 和 knowledge work 方面有所改进,Artificial Analysis 却表示它完全没有提升;两个模型都选择相信独立测量结果。它们还都发现,Google 四次引用 Artificial Analysis,却没有一次用于证明 intelligence。
和上一项测试一样,Opus 在事实层面取得了领先。它对 Anthropic 所称的“十三项中赢得八项”进行了 binomial 计算,发现抛 13 次硬币、出现至少 8 次正面的概率为 29%。它还发现,Anthropic 所称的 10 分优势来自一项只有 74 个任务的测试,样本规模小到这一差距完全可能只是运气。随后它又注意到,该测试的版本是 0.1,而且与模型在同一天发布。Opus 称这是“一项与其所验证模型共同开发的 eval 所留下的指纹”。怪物这是要反过来对付 Frankenstein 了吗?
同样和上一项测试一样,Fable 在整体推理方面略胜一筹。Fable 的备忘录只有 Opus 的一半长——我很喜欢这种罕见的简短 AI 回答——而且只有它指出,这些文件中的所有独立数据都来自同一家公司 Artificial Analysis。它给出的建议“只要一个 benchmark provider 出现问题,就必须重写”,意思是说,如果事实证明 Artificial Analysis 出错或遭到操纵,Fable 给出的模型建议也会变得不准确。
令我沮丧的是,Opus 和 Fable 都推荐了同一个模型:Opus 5,后面的关键结论部分还会进一步讨论。两个模型都没有意识到,这是 Anthropic 的模型在推荐 Anthropic 的模型。
Opus 的 API time 为 4 分 12 秒,使用 18.5K output tokens,成本 0.79 美元。Fable 耗时 2 分 3 秒,使用 9.5K tokens,成本 1.03 美元。
当两个模型都没能发现全部相互矛盾的说法时,很难判断究竟谁更好。不过,在三项测试中反复看到同一种模式后,我可以很有把握地说:Fable 更擅长推理,而 Opus 能看到更多细小的细节。至少目前,我的工作还是安全的。
以下是结果和成本图表:
在阅读图表之前,有一点需要注意。这些数量统计的是每个模型找到了多少项问题,而不是它思考得有多好。Fable 漏掉的每个问题,都是容易核对的小数字。两个模型没有被要求主动寻找、却额外发现的每一项洞见,都来自 Fable。
Fable 漏掉的每个问题,都是容易核对的小数字。两个模型没有被要求主动寻找、却额外发现的每一项洞见,都来自 Fable。
在三项测试中,两个模型生成的 token 总量几乎相同,分别是 99.9K 和 98.3K。Opus 更低的标价解释了成本差异中的很大一部分,但 billable token mix 和 model configuration 同样会产生影响。我真正想知道但可能永远不会知道的是:为什么 Opus 5 能便宜这么多?是因为它的 build 吗?还是纯粹为了吸引人们使用 Opus 5?这是不是 AI freemium 模式的一部分——一开始价格更低,之后却随着时间推移变得越来越贵?
最后,我准备结合上面的图表,读一读数字背后的含义。要想获得最佳结果,请同时使用两个模型,并让专家审核数据。
如果任务是找出摆在面前的每一项事实,就使用 Opus 5。它在三项测试中几乎什么都没漏掉,而且总成本低了 43%。
AI 的推理能力仍然不够完善。如果任务是找出摆在面前的每一项事实,就使用 Opus 5。它在三项测试中几乎什么都没漏掉,而且成本只有一半。
如果任务是理解所有事实综合起来意味着什么,Fable 显然是赢家。只有它重新计算了 revenue numbers,只有它解释了为什么那个 bug 如此难以复现,也只有它指出了自身建议中的薄弱环节。
如果任务是理解所有事实综合起来意味着什么,Fable 显然是赢家。
但它仍然需要改进。Fable 在 spreadsheet 测试中漏掉的两个问题都很基础,属于只要认真阅读、而不需要深入思考就能发现的问题。如果遗漏了一部分事实,再强的推理能力也会受到限制。Fable 展现出了真正的潜力,但仍需进一步提升。