Opus 5.5每百万Token降至4美元,同时有报告指出部分Agent调用可能被静默路由至早期版本,实际成本与性能可能与预期不符。
Claude Opus 5.5 来了,Anthropic 将价格下调了 20%。
这个于周二发布的新模型,输入令牌每百万收费 4 美元,输出令牌每百万收费 20 美元,比 Opus 5 便宜 20%,缓存读取从每百万 0.50 美元降至 0.20 美元,缓存写入从每百万 6.25 美元降至 5 美元。Anthropic 表示整体节省接近 40%,因为 Opus 5.5 完成一项任务所需的令牌更少,输出生成速度快了 30% 以上。
Claude Code 和 Claude Platform 还推出了快速模式,速度提升高达 2.5 倍,输入令牌每百万收费 8 美元,输出令牌每百万收费 40 美元。Anthropic 表示,Opus 5.5 在大多数工作中的表现大致达到 Fable 5.1 的水平,但在多个智能编码基准测试中表现更好。
Opus 5.5 在 Terminal-Bench 4.0 上得分为 66.4%,而 Fable 5.1 为 55.8%;在 FrontierCode 上为 54.4%,而 Fable 5.1 为 50.3%。该公司建议不要过度解读这些差距。该公司表示,在这个水平上,基准测试上的几分在现实使用中不会转化为明显差异。
Fable 5.1 输入令牌每百万收费 10 美元,输出令牌每百万收费 50 美元,是 Opus 5.5 价格的两倍多。在 FrontierCode 默认 effort 下,Opus 5.5 以约 20% 的单任务成本击败 GPT-6 Astra。在 CursorBench 上,它以约三分之一的价格领先 GPT-5.6 Sol 11 分。开发者在将生产工作负载迁移之前仍需运行自己的评估,但成本差异可能会改变智能编码的模型选择。
开发者仍需在迁移生产工作负载之前运行自己的评估,但成本差异可能会改变智能编码的模型选择。
更少令牌,更少 Agent 步数
早期企业数据显示,效率提升是真实的,至少在某些任务配置下如此。Box 报告称,Opus 5.5 在其评估中使用的令牌约为 Opus 5 的三分之一,同时生成的答案冗余度降低 40%,且未损失准确性。
GitHub 在 Copilot CLI 和 VS Code 中测试了该模型,发现它在不到一半的步数内完成了比 Opus 5 更多的终端任务。Deloitte 表示,Opus 5.5 最低 effort 设置在代码审查中捕获了 72% 的已知 bug,而 Opus 5 高 effort 设置仅为 56%,且误报更少、输出更短。
| 每百万令牌价格 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| 缓存读取 | $0.20 | $0.50 |
| 输入令牌 | $4 | $5 |
| 输出令牌 | $20 | $25 |
| 缓存写入 | $5 | $6.25 |
Anthropic 自己的内部测试支持这一模式。在一次正面交锋中,Opus 5.5 和 Fable 5.1 都将 HAProxy 从 C 翻译成 Rust;两个重写版本都通过了 HAProxy 几乎所有的回归测试,但 Opus 5.5 在 9.5 小时内完成,而竞品用了 12 小时,成本低 51%。一位早期测试者在不到三小时内审计并修复了一个包含 20 万行代码的代码库,而 Opus 5 花了超过 20 小时,消耗了 2.5 倍的令牌。另一位则在内天内完成了 68 万行代码的迁移。虽然这些是客户和内部评估,而非标准化独立基准,但它们指向同一个方向——更少的令牌和更少的步数来完成工作。
这一模式与整个行业正在发生的事情一致。Agent 性能在很大程度上取决于模型周围的工具和运行时,而非仅取决于模型本身——Agent 失败通常可追溯到编排层而非模型。Nvidia 的研究表明,在保持模型不变的情况下更换工具,可以有意义地改变 Agent 性能。
| 基准测试 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| 智能编码(Terminal-Bench 4.0) | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| 智能编码(FrontierCode v1.1) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| 智能编码(CursorBench 4.0) | 57.8% | 51.8% | 46.6% | — | 41.7% |
| 知识工作(GDPval-AA v2.1) | 1846 | 1735 | 1708 | 1542 | 1588 |
| 业务工作流(AutomationBench) | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| 多学科推理(HLE) | 67.7% | 65.6% | 63.6% | 57.2% | — |
| 智能科学研究(TBS 0.1) | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| 计算机使用(OSWorld 2.0) | 81.8% | 80.7% | 74.0% | — | — |
| 可视化图表识别(Chartography) | 89.0% | 88.4% | 83.4% | — | — |
安全分类器在链中透明路由
Opus 5.5 配备了与 Fable 5.1 上已运行的相同类别的安全分类器,覆盖网络安全、生物和前沿 LLM 开发。当分类器触发时,Anthropic 会将请求透明地路由到较旧的模型。大多数被标记的网络安全请求会转到 Opus 4.8。生物和前沿 LLM 标记会转到 Opus 5。Anthropic 表示,用户仍可以使用 Opus 5.5 来识别和修复自己代码中的 bug。
对于构建 Agent 工作流的任何人来说,这是需要架构关注的一个细节。发送到 Opus 5.5 的请求实际上可能由 Opus 4.8 或 Opus 5 处理,具体取决于 Anthropic 的安全防护是否介入。在多轮 Agent 工作流中,这会造成个别请求由具有不同能力的模型处理的可能性,这可能会影响下游步骤。这也是一种不一致的来源,可能不会在基于每个请求都发送到同一模型的假设构建的评估中显现。
经审核的组织可以申请加入 Anthropic 的生命科学验证计划,以在不附加生物分类器的情况下使用 Opus 5.5,该公司计划在未来几周内扩展其网络验证计划以将该模型纳入其中。新的网络计划将包括三个层级,对应不同程度的可信访问权限,包括对 Claude Mythos 模型的访问。
Opus 5.5 配备了与 Fable 5.1 上已运行的相同类别的安全分类器,覆盖网络安全、生物和前沿 LLM 开发。
对齐改进来自更干净的训练
Anthropic 表示,Opus 5.5 在其最全面的内部对齐评估中取得了该公司所测试过的所有模型中的最强结果,在该公司表示导致了近期网络安全事件的行为上有所改进,包括偏见推理和试图逃离沙盒环境。Frontier Design 和 METR 在发布前对该模型进行了评估。
在训练方面,Anthropic 正在加强对强化学习环境的过滤,因为在识别出有缺陷的环境是对齐行为偏差的主要来源后,该公司将此作为重点。这对对齐安全之外的领域也有意义,因为 RL 环境质量直接影响模型在 Agent 场景中的行为——模型在其中选择自己的工具并决定何时改变方法。该公司还在构建自动化方法,以生成新的安全训练场景并改进对齐奖励。
定价压力与路由权衡
Opus 5.5 是 Claude 5.5 系列的首个模型,Sonnet 5.5 和 Haiku 5.5 预计在未来几周内推出。所有计划的订阅用户五分钟用量限制均增加 20%,而 Anthropic 表示 Opus 5.5 的更低成本将使五分钟和每周限制的覆盖范围延长 25%。订阅用户还将获得一个累计的速率限制重置,可留待需要更多容量时使用。
此次发布之际,前沿实验室的 API 定价持续下降。OpenAI 今年夏天削减了自己的 API 价格,而 Opus 5.5 通过减少某些工作负载首先需要的令牌数量,将竞争推到了每令牌标称价格之外。
Opus 5.5 通过减少某些工作负载首先需要的令牌数量,将竞争推到了每令牌标称价格之外。