Sonnet 5.5 在 Terminal-Bench 4.0 达 70.6%,输出速度提升 30% 以上,同量 token 成本下降最多 30%。
Anthropic 刚刚发布了 Claude Sonnet 5.5。这是 Claude 5.5 系列的第二款模型,仅次于 Claude Opus 5.5。Anthropic 将其定位为 Opus 5.5 的更快、更低成本的补充版本。它面向范围明确的日常任务、bug 修复以及精心打磨的文档、幻灯片和电子表格。
可以部署吗?可以。 它已在 Claude Platform(claude-sonnet-5-5)、AWS、Google Cloud 和 Microsoft Azure 上线。由于是闭源模型,不支持自托管。
Anthropic 报告了相比 Sonnet 5 的四项主要升级:
速度:输出生成速度快了 30% 以上,成为迄今为止最快的 Sonnet。
单次任务成本:降低了高达 30%,因为所需 token 和工具调用更少。
写作: prose 更清晰,早期测试者称其为更好的协作伙伴。
视觉和长期任务:这是首款仅凭截图就能在 Pokémon Red 中超越 Opus 的 Sonnet。
规格一览:100 万 token 上下文、12.8 万最大输出、2026 年 6 月可靠知识截止日期。Adaptive thinking 默认开启。Effort 分为 5 个级别:low、medium、high、xhigh 和 max。
以下所有分数均为 Anthropic 在发布公告中提供的厂商报告分数。方法论见 Sonnet 5.5 System Card。
Terminal-Bench 4.0:70.6%,Sonnet 5 为 10.3%,Opus 5.5(Xhigh)为 66.4%。
CursorBench 4.0:55.5%,比 Opus 5.5(约 57.8%)低约 2 个百分点。
FrontierCode 1.1:Xhigh 下 52.1%,Max 下 46.2%。GPT-6 Sol 为 49.3%。
GDPval-AA v2.1:1844,Opus 5.5 为 1846,Sonnet 5 为 1449。
OSWorld 2.1:计算机使用 80.1%,接近 Opus 5.5(81.8%)。
Humanity's Last Exam:使用工具 64.5%,高于此前的 54.9%。
Max 结果低于 Xhigh 有其原因。在 Max 下,模型更频繁地运行多智能体代码审查。这有时会导致超时或超出范围的编辑,而 FrontierCode 会对这类情况扣分。Anthropic 同时指出,Opus 5.5 在复杂的开放性工作上仍然明显更强。
定价与 Sonnet 5 保持不变:每百万输入 token 2 美元,每百万输出 token 10 美元。缓存读取 0.20 美元,缓存写入 2.50 美元每百万。这是 Opus 5.5(4 美元/20 美元)的一半。节省来自 token 效率,而非降价。
客户数据支撑了这一点。Balyasny Asset Management 测量到每次回答约 12.1 万 token,而 Sonnet 5 为 49.7 万。Base44 报告每次应用构建 3.6 次迭代,而 Opus 5 需要 7.7 次。Zendesk 工单处理速度快了 20%。
Effort 默认值因界面不同而异。Claude Code 和 Claude apps 默认为 Medium。Claude Platform 默认为 High。
| Feature | Claude Sonnet 5.5 | GPT-6 Sol | Gemini 3.1 Pro Preview | Claude Opus 5.5 |
|---|---|---|---|---|
| Developer | Anthropic | OpenAI | Anthropic | |
| Price per 1M tokens (input/output) | $2 / $10 | $2 / $10 (prompts up to 272K) | $2 / $12 (prompts up to 200K) | $4 / $20 |
| Context window | 1M tokens | 1,050,000 tokens | 1,048,576 tokens | 1M tokens |
| Max output | 128K tokens | 128K tokens | 65,536 tokens | 128K tokens |
| Knowledge cutoff | June 2026 | April 20, 2026 | Not listed | June 2026 |
| Reasoning control | Adaptive thinking, 5 effort levels | 6 effort levels (none to max) | Thinking supported | Adaptive thinking (always on) |
| Inputs | Text, image | Text, image | Text, image, video, audio, PDF | Text, image |
| FrontierCode 1.1 | 52.1% (Xhigh) | 49.3% | Not reported | 54.4% |
| GDPval-AA v2.1 | 1844 | 1487 | Not reported | 1846 |
| Chartography (no tools) | 61.6% | 53.6% | Not reported | 64.4% |
| Release stage | Generally available | Generally available | Preview | Generally available |
| Open weights | No | No | No | No |
Benchmark 分数由 Anthropic 厂商报告;GDPval-AA 由 Artificial Analysis 运行。价格为标准 API 列表价,2026 年 9 月 28 日验证。
Claude Sonnet 5.5,交互式解读
点击查看基准测试、effort 级别、任务成本和 API 迁移检查器。

仪表盘展示的是 Anthropic 描述的方向(更高的 effort 意味着更长的推理和更多的工作检查)。建议来自 Sonnet 5.5 迁移指南。

节省来自更少的 token 和工具调用,而非更低的标价。实际比例取决于工作负载。

Sonnet 5.5 在 Terminal-Bench 4.0 上得分 70.6%,高于此前的 10.3%。

定价维持 $2/$10,但单次任务成本降低高达 30%。

在 GDPval-AA 上与 Opus 5.5 相差在 2 个百分点以内。

首款配备网络安全防护和推理提取分类器的 Sonnet。

现已通过 API、AWS、Google Cloud 和 Azure 部署。
查看官方公告、迁移指南和系统卡。所有荣誉归于该项目的研究人员。同时,欢迎关注我们的 Twitter,加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。你用 Telegram 吗?现在也可以加入我们了。
需要与我们合作推广你的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会吗?联系我们。
Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。Michal 在统计分析、机器学习和数据工程方面基础扎实,擅长将复杂数据集转化为可操作的洞察。