Sonnet 5.5 在 Terminal-Bench 编程测试从 10.3% 跃升至 70.6%,接近 Opus 5.5 水平,同时每个任务费用最多降低 30%,响应速度提升超 30%。
Anthropic 发布了 Claude Sonnet 5.5,生成速度提升超过 30%,通过更高效的 token 使用将每次任务成本削减最多 30%。
Sonnet 5.5 在编码和知识工作基准测试中表现大幅提升,在部分测试中以极低的成本几乎追平顶级 Opus 5.5。
该模型现已上线 AWS、Google Cloud 和 Azure。Anthropic 新增了针对网络安全风险和蒸馏攻击的防护措施。
Anthropic 发布了 Claude Sonnet 5.5,这是 Claude 5.5 系列的第二款模型。它生成速度提升超过 30%,每次任务成本降低最多 30%,在多项基准测试中几乎追平 Opus 5.5。
Opus 5.5 面向需要谨慎判断的复杂任务。Sonnet 5.5 则瞄准定义明确的日常工作,如修复 bug、撰写文档、制作演示文稿和创建电子表格。Anthropic 还宣布将在未来几周推出 Claude Haiku 5.5,该模型将专注于高吞吐量、低成本的使用场景。
有了 Fable、Opus 和 Sonnet,Anthropic 已经拥有了与 OpenAI GPT-6 Astra、Sol 和 Luna 对应的产品,后者引发了最新一轮的价格战。从大面上看,Opus 略高于 Sol,Sonnet 略高于 Luna,Fable 略高于 Astra,不过 Anthropic 各档位的定价都更高。同档位之间的性能差异很小,成本可能最终成为决定因素。Haiku 可以帮助 Anthropic 缩小这一差距。
编码性能大幅跃升
据 Anthropic 介绍,Sonnet 5.5 与前代之间性能差距最大的是编码领域。在面向 Agent 编码的 Terminal-Bench 4.0 测试中,Sonnet 5.5 达到 70.6%,而 Sonnet 5 仅为 10.3%。在 CursorBench 4.0(复现 Cursor 编辑器真实编码会话)中,Sonnet 5.5 得分 55.5%,Sonnet 5 为 34.1%,Sonnet 5.5 仅以 2 分之差落后于 Opus 5.5(57.8%)。
Anthropic 表示,在"High"档位下的 FrontierCode 1.1 中,Sonnet 5.5 得分比 Sonnet 5 高出 10 分,而每次任务成本约为前者的十五分之一。早期的测试者对该模型快速理解代码库的能力大加赞赏。Sonnet 5.5 批量处理工具调用的频率也高于前代,减少了所需步骤数。
推理强度有一个奇怪的例外。在最高努力等级"Max"下,Sonnet 5.5 在 FrontierCode 上的得分实际上反而低于"Xhigh"。Anthropic 解释说,在最大努力模式下,模型更频繁地触发代码审查功能,将工作分配给多个子 Agent。在某些情况下,这导致了超时或超出任务范围的变更,这两点都是 FrontierCode 会扣分的。
知识工作几乎追平 Opus 5.5
在 GDPval-AA(OpenAI 开发的知识工作基准测试,涵盖 44 个职业和 9 个行业的任务)中,Sonnet 5.5 得分为 1844 分,几乎追平 Opus 5.5(1846 分),比 Sonnet 5(1449 分)高出约 400 分。按 Anthropic 的数据,OpenAI 的 GPT-6 Sol 为 1487 分。在视觉图表识别测试 Chartography 中,Sonnet 5.5 从 15.6% 跃升至 61.6%。
¹ Opus 5.5 在 Terminal-Bench 4.0 中于"Xhigh"档位取得最高分。² Sonnet 5.5 在"Max"档位下 FrontierCode 得分低于"Xhigh"。³ Sonnet 5.5 的数据来自预发布版本,其中一个后续已修复的 bug 可能影响了结构化输出的结果。
早期测试者形容 Sonnet 5.5 是一位更自然的对话伙伴,对设计有感觉。Anthropic 声称,该模型可以重构用户界面、执行幻灯片模板,效果出色到几乎无需修改。
Anthropic 还表示,Sonnet 5.5 是首款仅凭截图就能通关《宝可梦:红》的 Sonnet 模型。OpenAI 的 Astra 最近在游戏基准测试中也展示了类似的进步。类似这样的任务在几年前还被认为是难题,通常需要定制算法。如今即便是产品线中的中端模型也能处理。
单位 token 价格不变,每次任务 token 更少
Sonnet 5.5 每百万 token 的价格与 Sonnet 5 相同:输入 token 2 美元,输出 token 10 美元,缓存读取 0.20 美元。Anthropic 表示,由于该模型每次任务使用的 token 更少,有效成本降低最多 30%。输出生成速度也提升超过 30%。独立测试仍有待验证这些说法。
与 Anthropic 的其他模型以及 OpenAI 的对标产品一样,Sonnet 5.5 提供了可调节的努力等级设置,让用户可以在输出质量和成本、速度之间权衡。Anthropic 表示,在低或中等设置下,Sonnet 5.5 已经在多项基准测试中超越了 Sonnet 5 的最佳成绩,而每次任务成本约为前者的十分之一。不过,为每个任务找到合适的努力等级,目前更多是门艺术而非科学。
更强模型的网络安全新防护
Claude Sonnet 5.5 现已登陆所有主流云平台,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。与 Opus 5.5 和 Sonnet 5 一样,Anthropic 提供该模型且承诺零数据保留。开发者可以通过 Claude Platform 使用模型 ID "claude-sonnet-5-5" 访问。
由于 Sonnet 5.5 在网络安全方面的能力远超其前代,Anthropic 首次为 Sonnet 系列模型增加了防护措施。涉及高风险网络安全任务的请求会被明显地重定向至 Sonnet 5。通过扩展的 Cyber Verification Program,符合条件的专业人员可以申请分级访问。
Anthropic 还添加了针对蒸馏攻击的安全分类器,与最强大型号所用的相同。这些措施是否真正有效,将在接下来几个月内见分晓。如果中国实验室一直在从这类攻击中获益,关闭这一途径可能会再次拉大与西方实验室之间的差距。