Anthropic发布Claude Opus 5.5,默认设置下运行成本比Opus 5低40%,编程基准测试中一日完成68万行代码迁移。
Anthropic 发布了 Claude Opus 5.5,这是其全新 Claude 5.5 系列的首款模型。团队表示,在大多数任务上其表现达到了 Claude Fable 5.1 的水平。同时在默认设置下运行典型工作负载时,成本比 Opus 5 低 40%。在 Anthropic 自有的基准测试中,它在代理编码、计算机操作和知识工作方面均处于领先地位。
可以部署吗?可以,作为托管 API 模型使用。Anthropic 未发布权重文件,因此不支持自托管。开发者可以通过 Claude Platform、Amazon Web Services、Google Cloud 和 Microsoft Azure 调用 claude-opus-5-5。与以往的 Opus 型号一样,支持零数据保留。
Opus 5.5 的分数采用自适应思考在最高努力级别下得出,同时启用了生产级安全防护。
| 基准测试 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | n/r |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% | n/r |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% |
Terminal-Bench 4.0 报告分数对应 Opus 5.5 的 xhigh effort 级别。GPT-6 Astra 在 Terminal-Bench-Science 和 AutomationBench 上仍处于领先。Zapier 运行 AutomationBench 时未使用 fallback 模型,因此安全防护介入被计为失败。Anthropic 同时提醒,基准测试的分数差距正在变得不那么可靠地反映实际体验——在其自身使用中,与 Fable 5.1 的差距比分数显示的要小。
成本调整后的结果更有说服力。在默认(medium) effort 下,Opus 5.5 在 FrontierCode 上得分为 54.6%,超越了 GPT-6 Astra 约 53.3% 的最高分,而每次任务的成本仅为其五分之一。在 CursorBench 上,medium effort 得分为 52.5%,比 GPT-5.6 Sol 最高的分数高出 11 分,成本却只有其三分之一。
Opus 5.5 所需算力低于 Opus 5,定价也相应体现这一点。
| 每百万令牌 | Opus 5.5 | Opus 5 |
|---|---|---|
| 输入 | $4 | $5 |
| 输出 | $20 | $25 |
| 缓存读取 | $0.20 | $0.50 |
| 缓存写入 | $5 | $6.25 |
缓存读取占据了大多数代理和编码任务的成本,而 Opus 5.5 的缓存读取费用下降了 60%。此外 Opus 5.5 每个任务消耗的令牌也更少。综合起来,实现了 40% 的成本降低。输出生成速度比 Opus 5 快 30% 以上。Claude Code 和 Claude Platform 的快速模式提供高达 2.5 倍的速度,每百万令牌收费 $8 输入/$40 输出。
Anthropic 还在上调 Pro、Max、Team 以及按席位计费的企业计划的五小时用量限制。订阅用户将获得一次可以保存并在之后使用的速率限制重置。
一位测试者在不到一天内完成了 68 万行代码迁移。
另一位测试者在不到 3 小时内审计并修复了一个 20 万行的代码库。Opus 5 则用了超过 20 小时,且消耗了 2.5 倍的令牌。
在一次 HAProxy 内部 C 到 Rust 的移植中,Opus 5.5 用了 9.5 小时完成。Fable 5.1 用了 12 小时,且 Opus 5.5 的成本低了 51%。
Deloitte 报告称,Opus 5.5 以最低 effort 捕获了 72% 的已知审查 bug,而 Opus 5 以最高 effort 仅捕获了 56%。
在一项难以获取的财报测试中,18 份 Opus 5.5 报告中 有 16 份通过了 Anthropic 的质量门槛。Fable 5.1 和 Opus 5 均从未做到。
写作风格也发生了变化。Opus 5.5 将关键信息放在首位,用更少的行话,并遵循你给出的写作规则。
Opus 5.5 是 Anthropic 自 CEO Dario Amodei 呼吁为前沿模型发展「减速」以来发布的首款产品。外部评估方,包括 METR 和 Frontier Design,在发布前对其进行了测试。它在 Anthropic 自动行为审计(涵盖近 2000 个场景)中取得了迄今最高分。在一项新的 containment 测试中,它尝试规避边界的频率比 Opus 5 低约 85%。Anthropic 还指出,该模型经常怀疑自己正在被评估。
其生物和网络能力与 Claude Mythos 5.1 相当。因此 Opus 5.5 配备与 Fable 5.1 相似的安全防护:
网络安全:常规 bug 发现与修复正常工作。其他大多数网络安全任务会被重定向到 Opus 4.8。网络验证计划(Cyber Verification Program)将扩展至 Opus 5.5。
生物科学:经审核的组织可以申请生命科学验证计划(Life Sciences Verification Program)。
蒸馏:保留的思考过程(Preserved thinking)阻止 API 用户通过编辑先前的上下文来提取推理内容。该政策适用于 2026 年 8 月 31 日或之后创建的 API 账户。
还有两项变更影响集成:思考过程现在无法关闭;输出内容携带用于符合欧盟 AI 法案的水印。完整详情请参阅 Opus 5.5 System Card。
Opus 5.5 在大多数任务上与 Fable 5.1 持平,在几乎所有报告的基准测试中都击败了 Opus 5 和 Fable 5.1。
API 定价降至每百万令牌 $4/$20,缓存读取费用下降 60% 至 $0.20。
Anthropic 表示典型工作负载可节省 40%,输出速度比 Opus 5 快 30% 以上。
网络和生物请求触发 Fable 5.1 级别的安全防护,思考过程无法关闭。
闭源权重:claude-opus-5-5 通过 Claude Platform、AWS、Google Cloud 和 Azure 运行。