Anthropic 发布 Claude Sonnet 5,多项 agentic 和编程基准测试超越 Opus 4.8,价格低 40%,已取代 Free/Pro 默认模型。
2026 年 6 月 30 日,Anthropic 发布了一款模型,在保持比自家旗舰便宜 40% 的同时,将与旗舰之间的差距收窄了大半。据 Anthropic 官方公告,Claude Sonnet 5 于 7 月 1 日起成为 claude.ai 上所有 Free 和 Pro 用户的默认模型——不是分阶段推送,不是可选 beta,而是直接在一夜之间成为数百万用户的新基线。
对于一款中端模型而言,这是一个大胆的举动。Sonnet 历来是"够用就好"的选择——当 Opus 显得杀鸡用牛刀时才会用它。Sonnet 5 改变了这道算术题:在多项 agentic 和 coding 基准测试中,它现在已经直接超越了 Opus 4.8,其余项目也仅以个位数的差距落后。
本文将拆解这次实际发布了什么、Sonnet 5 与 Opus 4.8 在真实基准数据上的对比、新定价对大规模运行 agent 的团队意味着什么,以及你是否应该现在就切换默认模型。
Anthropic 称其为"迄今为止最具 agentic 能力的 Sonnet 模型"。具体来说,这意味着 Sonnet 5 能够规划多步骤任务、操作浏览器和终端等工具,而且——据 TechCrunch 对这次发布的报道——它能以此前只有更大、更昂贵的模型才能达到的水平自主运行。
VentureBeat 报道,此次发布正值 Anthropic 推进一项广泛传闻的 IPO,而一款性能接近 Opus 4.8 且更便宜的模型,是扩大使用量同时不压缩利润率的直接手段。

这是开发者真正关心的数字:更便宜的模型是否足够好用,可以取代更贵的那款?基于 MarkTechPost 和 The New Stack 整理的基准数据,答案是:比预期更接近,而且在某些类别中,Sonnet 5 实际上赢了。
这个模式很说明问题:Opus 4.8 在纯 coding 基准(如 SWE-bench Pro)上仍领先,但 Sonnet 5 特别是在 agentic、终端驱动和知识工作类任务上反超——而这些类别对于构建自主 agent 而非一次性代码生成的团队最为重要。Anthropic 引用的早期访问测试者描述这款模型"能完成此前 Sonnet 模型会中途停下的复杂任务",并且会在不主动要求的情况下检查自己的输出。
基准测试只是故事的一半。对于每天运行数千次 agent 调用的团队来说,每个 token 的价格才是最终体现在账单上的数字。
Sonnet 5 以 introductory pricing 上线:输入每百万 token 2 美元,输出每百万 token 10 美元,有效期至 2026 年 8 月 31 日。之后转为标准定价:输入 3 美元 / 输出 15 美元每百万 token——仍比 Opus 4.8 的输入 5 美元 / 输出 25 美元每百万 token 便宜约 40%,claudefa.st 的定价对比确认了这一点。
在迁移生产工作负载之前有一个值得注意的注意事项:Sonnet 5 附带了一个新 tokenizer,相比 Sonnet 4.6,对相同文本产生的 token 数多出约 30%。每 token 定价没有变,但如果在容量规划中没有考虑到新的 token 数量,每请求的有效成本仍可能发生变化。
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2026-01-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5",
"max_tokens": 1024,
"messages": [{"role": "user", "content": "Refactor this function for readability."}]
}'

三个结构性变化解释了大部分基准排名变动:
Tokenizer 大换血。 新的 tokenizer 不只是一个成本变量——它改变了模型分割代码和结构化文本的方式,这一定程度上解释了终端和 agentic 任务上的收益。
默认 100 万上下文。 此前的 Sonnet 版本将 100 万窗口藏在 beta header 后面。Sonnet 5 将其设为标准,这对你需要将整个代码库或长工具调用轨迹完整保留在上下文中而不被截断的 agent 至关重要。
自检行为。 多位早期测试者注意到模型在任务中途验证自己的输出——更接近 Opus 的行为——而不是停在第一个看似合理的答案上。
这三个变化共同解释了为什么 BenchLM 等独立比较中 Opus 4.8 与 Sonnet 5 的 breakdown 将 Sonnet 5 的总体综合得分定为 94,而 Opus 4.8 为 92——尽管 Opus 在纯 coding 准确率上仍胜出。
决策取决于你的工作负载实际长什么样:
运行长周期 agent(终端自动化、多工具工作流、研究 pipeline)? Sonnet 5 现在在相关基准上与 Opus 4.8 持平或更好,成本低 40%。切换。
做重度的复杂代码生成,SWE-bench 风格的准确率是首要需求? Opus 4.8 仍有明显领先——为此保留它。
固定预算下的混合工作负载? 将 agentic 和终端密集型任务路由到 Sonnet 5,把 Opus 4.8 的调用留给最难的 coding 任务。大多数生产级 agent 框架已经支持按任务路由模型,所以除了一个配置变更之外不需要额外成本。
无论哪种情况,在生产环境中切换默认模型之前重新跑一遍 token 统计——30% 的 tokenizer 增量很容易被忽略,直到账单寄到。
Claude Sonnet 5 可以免费使用吗? 是的,它是 2026 年 7 月 1 日起 claude.ai 上 Free 层用户的默认模型,同时适用于 Pro、Max、Team 和 Enterprise 计划。API 访问需要付费的 Anthropic 账户。
Claude Sonnet 5 比 Opus 4.8 更好吗? 取决于任务。Sonnet 5 在 agentic 工作流、终端自动化和知识工作基准上胜出,而 Opus 4.8 在纯 coding 准确率(如 SWE-bench Pro)上仍领先。
Claude Sonnet 5 的 API 定价是多少? 2026 年 8 月 31 日前的 introductory pricing 为输入每百万 token 2 美元、输出每百万 token 10 美元,之后调整为 3 美元 / 15 美元每百万 token。
Claude Sonnet 5 支持 100 万 token 上下文窗口吗? 支持,而且与之前的 Sonnet 版本不同,它默认启用,无需 beta header。
切换到 Sonnet 5 后我的 token 使用量为什么会增加? Sonnet 5 使用了新 tokenizer,相比 Sonnet 4.6,对相同输入文本产生的 token 数多出约 30%,尽管每 token 价格不变。
Claude Sonnet 5 不仅仅是一次常规的版本迭代——它是 Anthropic 在赌:一款更便宜、更具 agentic 能力的中端模型可以承接此前需要旗舰才能完成的大部分工作。对于终端驱动的 agent 和长周期自动化,基准数据支持这个赌注。对于需要每一个 coding 准确率分数的团队,Opus 4.8 仍值得它更高的价格标签。
2026 年真正的结论:聪明的做法不是选一个模型——而是把任务路由到真正适合它的模型。