Opus 5.5成本降低40%、速度更快,但在推理任务上并未超越Opus 5,benchmark测试显示两者差异不大。
Anthropic 本周发布 Claude Opus 5.5 时,宣称新模型成本比 Opus 5 低 40%,生成速度提升 30%。Anthropic 的营销提出了三个主张:Opus 5.5 达到了 Claude Fable 5.1 的水平(因此应该超越 Opus 5)、典型工作负载下成本比 Opus 5 低 40%、生成速度提升超过 30%。
Anthropic 还下调了开发者通过 API 使用模型的费用。Opus 5.5 的输入价格为每百万 token(每段文本约四分之三个词长)4 美元,输出价格为每百万 token 20 美元,而 Opus 5 为 5 美元和 25 美元。仅这一项降价就贡献了 20% 的节省。剩下的 40% 节省必须来自模型使用更少的 token。
我想看看这对普通 Claude 用户意味着什么,所以这次跳过了常规的开发者工作流模拟测试。近来我测试的模型在日常任务上表现都不错。推理任务是我见过它们吃力的地方,所以我只针对推理任务测试了 Opus 5 和 Opus 5.5。
如果你想在自己的系统上复现这些测试,可以在本文底部找到提示词。
我通过 Anthropic API 调用两个模型,使用完全相同的提示词。两个模型都以默认努力级别的自适应思考模式运行,因为 Opus 5.5 不允许关闭思考功能。每个问题每个模型只运行一次。我原本计划在模型给出不同结果时重新运行任何问题,但它们从未给出不同答案。
以下是我运行的测试:
逻辑网格(中等难度) — 七位工程师各自有一个值班日、一门语言、一个服务和一个城市,22 条线索锁定一个答案。六条线索是条件句或"恰好有一条为真"陈述,移除任何单条线索都会使谜题无法解开。
约束排序(困难难度) — 重新排列 10 个部署任务,使得没有任务留在原槽位,且没有两个连续编号的任务相邻。模型需要给出 6、8 和 10 个任务的计数。
记忆石子游戏(更难难度) — 玩家移除 2、5、7 或 11 颗石子,但不能重复对手上次移动的步数或自己上次的步数。模型需要找出从 200 颗石子开始谁赢、统计到 500 为止的失败起始数量,以及命名 340 以上最小的失败数量。
我对每次调用记录了输入 token 数、输出 token 数、按标价计算的花费和时间。思考 token 按输出计费,所以我将其包含在内。
两个模型都答对了全部 28 个单元格。Opus 5.5 用时 65 秒,输出 7,573 个 token,花费 $0.16。Opus 5 用时 108 秒,输出 10,621 个 token,花费 $0.27。
在这个测试中,Opus 5.5 便宜了 43%,得到了相同的正确答案。Opus 5.5 稍微更详细,指出它没有完全证明解是唯一的。
两个模型都没有给出答案,这使其成为实际意义上最难的题目。正确答案是 27、1,695 和 159,019。第三个答案很难仅靠推理得出。能够检查每种排序的计算机程序可以找到它,但两个模型在这个测试中都无法运行代码。
在 48,000 token 的输出限制下,两个模型用光了全部预算进行思考,始终没有回复。Opus 5.5 用时 489 秒,花费 $0.96。Opus 5 用时 553 秒,花费 $1.20。
我将限制提高到 128,000 token 并重新运行。Opus 5 用尽了每个 token,用时超过 25 分钟,最终没有答案就停止了。花销 $3.20。Opus 5.5 运行了 19 分钟,使用了 112,733 个 token,但 API 以"拒绝"作为停止原因结束响应,没有附带任何文本。提示词要求模型计数任务排序,不包含任何敏感内容。这意味着拒绝很可能是 Anthropic 安全过滤器的误报,标记了一个无害请求。
Opus 5.5 更便宜,但如果拿不到结果,那便宜又有什么意义?
我们又回到了相同的答案。两个模型都正确回答了全部三部分。从 200 颗石子开始,先手输;从 120 到 500 的起始数量都是失败,340 以上最小的失败数量是 344。
这次测试的差异在于每个模型到达答案所需的思考量。Opus 5.5 用时 215 秒完成,输出 28,740 个 token,花费 $0.58。Opus 5 用时 624 秒,生成 74,981 个 token,花费 $1.88。Opus 5.5 少用了 62% 的 token,相同答案下成本降低了 69%。
| 测试 | Opus 5.5 | Opus 5 |
|---|---|---|
| 逻辑网格 | 28/28, 1:05, 908入/7573出, $0.16 | 28/28, 1:48, 906入/10621出, $0.27 |
| 排序问题(48k 限制) | 无答案, 8:09, 235入/48000出, $0.96 | 无答案, 9:13, 233入/48000出, $1.20 |
| 排序问题(128k 限制) | 无答案(拒绝), 18:56, 235入/112733出, $2.26 | 无答案, 25:24, 233入/128000出, $3.20 |
| 石子游戏 | 3/3, 3:35, 323入/28740出, $0.58 | 3/3, 10:24, 321入/74981出, $1.88 |
| 总 token | 1701入/197046出 | 1693入/261602出 |
| 总时间 | 31 分 45 秒 | 46 分 49 秒 |
| 总费用 | $3.95($4入/$20出 每百万) | $6.55($5入/$25出 每百万) |
在所有调用中,Opus 5.5 每秒写入 103.4 个 token,Opus 5 为 93.1 个,因此 Opus 5.5 快了约 11%。它在单个问题上最大的速度领先是 19%,仍未达到 Anthropic 宣称的 30%。它最大的成本节省来自石子游戏,从 Opus 5 的 $1.88 降到 $0.58,节省了 69%。测试总花费为 $10.50。
Anthropic 的基准测试显示 Opus 5.5 在编码、知识工作和推理方面领先于 Opus 5。我没有重新运行那些基准测试。我给两个模型出了完全相同的三个推理问题,它们的表现相当。两个模型都解出了逻辑网格和石子游戏,都在排序问题上失败了。
节省是真实的。Opus 5.5 在每个问题上都更便宜、更快完成,包括逻辑网格省 43%、石子游戏省 69%。大部分节省来自使用更少的输出 token。价格下调贡献了 20%。它的写作速度快了 11%,未达到 Anthropic 宣称的 30%。
如果你现在运行 Opus 5,请切换到 Opus 5.5。在困难的推理任务上花更少的钱、更少的等待时间,得到相同的结果。不过,要在困难问题上设置硬性输出限制并关注花费。两个模型都可能思考近 20 分钟或更久而不返回任何内容,如果你为每个 token 付费,这就是个问题。对于类似排序测试的计数问题,给模型一个代码执行工具,而不是指望它靠推理完成。
七位工程师(Ana、Ben、Cy、Dee、Eli、Fay、Gus)共享一个值班轮换。每个人恰好在一周的某一天(周一到周日,周一最早,周日最晚)值班,没有两人同日。每个人写一门不同的语言(Go、Rust、Python、Java、Kotlin、TypeScript、C++)、拥有一个不同的服务(auth、billing、search、queue、cache、gateway、metrics)、在不同的城市(Berlin、Tokyo、Denver、Lagos、Sydney、Toronto、Mumbai)。
确定完整分配。在回复末尾,准确给出七行,每位工程师一行,按 Ana、Ben、Cy、Dee、Eli、Fay、Gus 的顺序,格式如下:
ANSWER: Name | Day | Language | Service | City
构建系统有 n 个部署任务,编号为 1 到 n。原来,任务 k 运行在槽位 k。你将所有 n 个任务重新排列到槽位 1 到 n(每个槽位一个任务),遵守两条规则:
对于 (a) n = 6、(b) n = 8、(c) n = 10,有多少种有效排序?
在回复末尾,准确给出三行,格式如下:
ANSWER a: <number>
ANSWER b: <number>
ANSWER c: <number>
两位玩家用一堆石子玩游戏。他们交替回合。每回合,一位玩家恰好移除 2、5、7 或 11 颗石子,受两条规则约束:
(在游戏的第一回合,两条规则都不适用。在第二玩家的第一回合,只适用第一条规则。)你不能移除比堆中更多的石子。如果一位玩家在自己的回合没有合法移动,则输掉游戏。两位玩家都完美游戏。
(a) 从 200 颗石子开始,先手赢吗?
(b) 从 1 到 500(含)的起始堆大小中,有多少个先手输?
(c) 大于 340 的最小失败起始堆大小是多少?
在回复末尾,准确给出三行,格式如下:
ANSWER a: <yes or no>
ANSWER b: <number>
ANSWER c: <number>