Anthropic 发布 Claude Sonnet 4.6 新一代模型
Anthropic 发布 Claude Sonnet 4.6,性能与推理能力迎来重大升级,直接影响 AI 编程工具效能。
Anthropic 发布 Claude Sonnet 4.6,性能与推理能力迎来重大升级,直接影响 AI 编程工具效能。
Claude Sonnet 4.6 是我们迄今为止最强大的 Sonnet 模型。它在编码、计算机使用、长上下文推理、Agent 规划、知识工作和设计等各个方面都进行了全面升级。Sonnet 4.6 还支持 1M token 上下文窗口(处于 beta 阶段)。
对于我们的 Free 和 Pro 计划用户,Claude Sonnet 4.6 现在是 claude.ai 和 Claude Cowork 的默认模型。价格与 Sonnet 4.5 保持一致,从每百万 token 3 美元/15 美元起。
Sonnet 4.6 为更多用户提供了大幅改进的编码能力。在一致性、指令遵循等方面的改进使得有早期访问权限的开发者明显倾向于选择 Sonnet 4.6 而不是其前身。他们甚至经常更倾向于选择 Sonnet 4.6 而非我们 2025 年 11 月发布的最强模型 Claude Opus 4.5。
之前需要使用 Opus 级别模型才能实现的性能——包括真实且具有经济价值的办公任务——现在可以通过 Sonnet 4.6 获得。与之前的 Sonnet 模型相比,该模型在计算机使用技能方面也显示出了重大改进。
与每个新的 Claude 模型一样,我们对 Sonnet 4.6 进行了广泛的安全评估,总体表明它与我们其他最近的 Claude 模型一样安全,甚至更安全。我们的安全研究人员得出结论,Sonnet 4.6 具有"广泛的热心、诚实、亲社会且有时幽默的特性,非常强大的安全行为,以及在高风险不对齐形式周围没有重大问题的迹象"。
几乎每个组织都有软件难以轻易自动化:这些是在 API 等现代接口出现前构建的专用系统和工具。要让 AI 使用这样的软件,用户以前必须构建定制连接器。但是一个能像人类一样使用计算机的模型改变了这个方程式。
在 2024 年 10 月,我们是首个推出通用计算机使用模型的团队。那时,我们写道这"仍然是实验性的——有时繁琐且容易出错",但我们预期会快速改进。AI 计算机使用的标准基准 OSWorld 展示了我们的模型已经走了多远。它在模拟计算机上运行的真实软件(Chrome、LibreOffice、VS Code 等)中呈现了数百项任务。没有特殊的 API 或目的构建的连接器;模型看到计算机并以人类的方式与之互动:点击(虚拟)鼠标并在(虚拟)键盘上打字。
在十六个月的时间里,我们的 Sonnet 模型在 OSWorld 上实现了稳步进展。这些改进也可以在基准之外看到:Sonnet 4.6 的早期用户在诸如导航复杂电子表格或填写多步骤网络表单等任务中看到了人类级别的能力,然后在多个浏览器标签页中汇总所有内容。
该模型肯定仍然落后于最熟练的人类在使用计算机方面的水平。但进展的速度仍然值得注意。这意味着计算机使用对于一系列工作任务更加有用——而且大幅提升能力的模型触手可及。
与此同时,计算机使用也带来风险:恶意行为者可以尝试通过在网站上隐藏指令(称为提示注入攻击)来劫持模型。我们一直在努力提高模型对提示注入的抵抗力——我们的安全评估表明 Sonnet 4.6 与其前身 Sonnet 4.5 相比是一个重大改进,表现与 Opus 4.6 相似。你可以在我们的 API 文档中找到更多关于如何缓解提示注入和其他安全问题的信息。
除了计算机使用外,Claude Sonnet 4.6 在各项基准上都有改进。它以更实际的价格点接近 Opus 级别的智能。你可以在我们的系统卡中找到 Sonnet 4.6 能力和安全相关行为的完整讨论;下面是总结以及与其他最近模型的比较。
在 Claude Code 中,我们的早期测试发现用户在约 70% 的时间内更倾向于选择 Sonnet 4.6 而不是 Sonnet 4.5。用户报告说它更有效地读取上下文后再修改代码,并整合共享逻辑而不是复制它。这使其在长时间会话中的使用体验比早期模型更少令人沮丧。
用户甚至在 59% 的时间内更倾向于选择 Sonnet 4.6 而不是 Opus 4.5,我们 11 月份的前沿模型。他们将 Sonnet 4.6 评为明显不太容易过度工程化且"懒惰",在指令遵循方面显著更好。他们报告了更少的虚假成功声明、更少的幻觉和更一致的多步骤任务跟进。
Sonnet 4.6 的 1M token 上下文窗口足以在单个请求中容纳整个代码库、冗长的合同或数十篇研究论文。更重要的是,Sonnet 4.6 能够在所有这些上下文中进行有效推理。这可以使其在长期规划方面表现得更好。我们在 Vending-Bench Arena 评估中特别清楚地看到了这一点,该评估测试模型如何能够长期运营(模拟)业务——并包含竞争元素,不同的 AI 模型相互竞争以获得最大利润。
Sonnet 4.6 开发了一个有趣的新策略:它在前十个模拟月份中大量投资产能,花费明显超过竞争对手的资金,然后在最后阶段急剧转向专注于盈利能力。这个转折的时机帮助它远超竞争对手完成。
早期客户也报告了广泛的改进,前端代码和财务分析尤其突出。客户独立描述 Sonnet 4.6 的视觉输出明显更精致,与之前的模型相比具有更好的布局、动画和设计品味。客户也需要更少的迭代轮次来达到生产质量的结果。
在 Claude 平台上,Sonnet 4.6 支持自适应思考和扩展思考,以及处于 beta 阶段的上下文压缩,它会自动总结较旧的上下文,当对话接近限制时增加有效上下文长度。
在我们的 API 上,Claude 的网络搜索和获取工具现在自动编写和执行代码以筛选和处理搜索结果,仅在上下文中保留相关内容——改进了响应质量和 token 效率。此外,代码执行、内存、程序化工具调用、工具搜索和工具使用示例现在已普遍可用。
Sonnet 4.6 在任何思考工作量下都提供强大的性能,即使禁用扩展思考也是如此。作为从 Sonnet 4.5 迁移的一部分,我们建议在整个频谱中探索,找到最佳的速度和可靠性能平衡,具体取决于你正在构建的内容。
我们发现 Opus 4.6 仍然是需要最深入推理的任务的最强选择,例如代码库重构、在工作流中协调多个 Agent,以及需要万无一失的问题。
对于 Claude in Excel 用户,我们的加载项现在支持 MCP 连接器,让 Claude 可以与你日常使用的其他工具协作,如 S&P Global、LSEG、Daloopa、PitchBook、Moody's 和 FactSet。你可以要求 Claude 从电子表格外拉入上下文,而无需离开 Excel。如果你已经在 Claude.ai 中设置了 MCP 连接器,这些相同的连接将在 Excel 中自动工作。这在 Pro、Max、Team 和 Enterprise 计划中可用。
Claude Sonnet 4.6 现在在所有 Claude 计划、Claude Cowork、Claude Code、我们的 API 和所有主要云平台上可用。我们还将免费层升级为默认使用 Sonnet 4.6——它现在包括文件创建、连接器、技能和压缩。
如果你是开发者,可以通过 Claude API 使用 claude-sonnet-4-6 快速入门。
对于 GPT-5.2 和 Gemini 3 Pro,我们在图表和表格中比较了通过 API 提供的最佳报告模型版本。
OSWorld:OSWorld 在受控环境中测试特定的计算机任务集。它是我们所拥有的最佳计算机使用测度之一,但不是真实世界计算机使用的完整图景。真实世界的计算机使用通常更杂乱、更模糊,对错误的风险更高。还没有基准能完全捕捉到这一点。
Terminal-Bench 2.0:我们报告了在我们基础设施上复制的分数和其他实验室发布的分数。除了 OpenAI 的 Codex CLI 外,所有运行都使用 Terminus-2 工具。所有实验都使用 1× 保证/3× 上限资源分配和 5-15 个样本,分批进行交错。报告的 Sonnet 4.6 分数是在思考关闭的情况下。
SWE-bench Verified:我们的分数是在 10 次试验中平均。使用提示修改,我们看到分数为 80.2%。
Humanity's Last Exam:Claude 模型运行"带工具"使用网络搜索、网络获取、代码执行、程序化工具调用、在 50k token 处触发的上下文压缩达到 3M 总 token、最大推理工作量和启用自适应思考。使用了域黑名单来清除评估结果。
BrowseComp:Claude 模型运行网络搜索、网络获取、程序化工具调用、在 50k token 处触发的上下文压缩达到 10M 总 token、最大推理工作量且禁用思考。
ARC-AGI-2:Claude Sonnet 4.6 使用最大和高工作量以及 120k 思考预算分数运行。显示的分数反映最大工作量;使用高工作量,我们实现 60.4% 的分数。
MMMU-Pro:我们对 MMMU-Pro 实现进行了两个小更新,影响了分数:1) 我们之前的实现包含前缀"Let's think step-by-step,",我们已将其移除,2) 我们之前通过查看多选项选项的策略内 token 概率对此多选评估进行评分;我们现在使用单独的模型(Claude Sonnet 4)进行评分。
Cognizant 和 Anthropic 扩展伙伴关系以将 Claude 引入企业客户
Opus 5 是对为长时间运行 Agent 提供支持的 Opus 层的阶跃改进,同时在编码和专业工作中实现改进。