Anthropic 正式发布 Claude Opus 4.6,社区热度极高(2346 赞、1031 讨论)。作为重大模型迭代,将直接影响程序员的 AI 辅助编程体验和工具选型。
我们正在升级最强大的模型。
新的 Claude Opus 4.6 在其前身的编码技能基础上有所改进。它计划更周密,能维持 Agent 任务更长时间,可以在更大的代码库中更可靠地运行,代码审查和调试技能也更强,能够发现自身的错误。而且作为我们 Opus 级模型的首次创新,Opus 4.6 具有 1M token 的上下文窗口(beta 阶段)。
Opus 4.6 还能将其改进的能力应用于各种日常工作任务:进行财务分析、开展研究,以及使用和创建文档、电子表格和演示文稿。在 Cowork 中,Claude 可以自主地进行多任务处理,Opus 4.6 可以代表你发挥所有这些技能。
该模型在多个评估中达到了业界最先进的水平。例如,在 Agent 编码评估 Terminal-Bench 2.0 中获得最高分,在复杂的跨学科推理测试 Humanity's Last Exam 中领先所有其他前沿模型。在 GDPval-AA(评估在金融、法律等领域经济价值知识工作任务上表现的评估)上,Opus 4.6 的表现超过行业次优模型(OpenAI 的 GPT-5.2)约 144 Elo 分,超过其自身前身版本(Claude Opus 4.5)190 分。Opus 4.6 在 BrowseComp 上的表现也优于任何其他模型,该评估衡量模型在线查找难以找到的信息的能力。
正如我们的详细系统卡片所示,Opus 4.6 的整体安全性与行业内任何其他前沿模型一样好或更好,在安全评估中不对齐行为的发生率低。
在 Claude Code 中,你现在可以组建 Agent 团队一起处理任务。在 API 上,Claude 可以使用压缩功能来总结自己的上下文,并执行更长时间的任务,而不会突破限制。我们还引入了自适应思考,让模型可以根据上下文线索了解应该使用多少扩展思考功能,以及新的工作量控制,让开发者可以更好地控制智能水平、速度和成本。
我们大幅升级了 Claude in Excel,并在研究预览中发布了 Claude in PowerPoint。这使 Claude 的日常工作能力大大增强。
Claude Opus 4.6 今天在 claude.ai、我们的 API 和所有主要云平台上提供。如果你是开发者,可以通过 Claude API 使用 claude-opus-4-6。定价保持不变,为每百万 token 5 美元/25 美元;完整详情请参考我们的定价页面。
我们在下面深入介绍了模型、我们的新产品更新、我们的评估和我们的广泛安全测试。
我们用 Claude 构建 Claude。我们的工程师每天都用 Claude Code 编写代码,每个新模型首先都在我们自己的工作中进行测试。在 Opus 4.6 中,我们发现该模型在未被要求的情况下更加专注于任务最具挑战性的部分,快速处理更直接的部分,以更好的判断力处理模糊的问题,并在更长的会话中保持高效。
Opus 4.6 通常会更深入地思考,并在确定答案前更仔细地重新考虑其推理。这在较难的问题上产生更好的结果,但在简单的问题上可能增加成本和延迟。如果你发现模型在给定任务上过度思考,我们建议将工作量从默认设置(高)降低到中等。你可以通过 /effort 参数轻松控制这一点。
以下是我们的早期访问合作伙伴对 Claude Opus 4.6 的一些看法,包括它在无需手把手指导下自主工作的倾向、它在前代模型失败的地方取得成功的情况,以及它对团队工作方式的影响:
在 Agent 编码、计算机使用、工具使用、搜索和金融方面,Opus 4.6 是行业领先的模型,通常领先幅度很大。下表显示了 Claude Opus 4.6 与我们之前的模型以及行业其他模型在各种基准上的对比。
Opus 4.6 在从大型文档集中检索相关信息方面表现得好得多。这延伸到了长上下文任务,其中它在数十万 token 中保持和跟踪信息时漂移更少,并捕获即使是 Opus 4.5 也会错过的隐藏细节。
关于 AI 模型的一个常见抱怨是"上下文衰退",即当对话超过一定的 token 数量时性能会下降。Opus 4.6 的表现明显优于其前身:在 MRCR v2 的 8-needle 1M 变体上——这是一个测试模型在大量文本中检索"隐藏"信息的针头大海捞针基准——Opus 4.6 得分为 76%,而 Sonnet 4.5 仅得 18.5%。这是模型实际上可以使用多少上下文同时保持峰值性能方面的质的转变。
总的来说,Opus 4.6 更擅长在长上下文中查找信息,更擅长在吸收该信息后进行推理,并且在一般的专家级推理能力上有实质性改进。
最后,下面的图表显示了 Claude Opus 4.6 在各种基准上的表现,这些基准评估其软件工程技能、多语言编码能力、长期连贯性、网络安全能力和生命科学知识。
这些智能增益并非以牺牲安全为代价而来。在我们的自动化行为审计中,Opus 4.6 显示欺骗、谄媚、鼓励用户妄想和与滥用合作等不对齐行为的发生率低。总体而言,它与其前身 Claude Opus 4.5 一样良好对齐,而后者是我们迄今为止最对齐的前沿模型。Opus 4.6 也显示了最近任何 Claude 模型中最低的过度拒绝率——即模型未能回答良性查询的情况。
对于 Claude Opus 4.6,我们进行了任何模型中最全面的安全评估,应用许多首次测试的方法并升级了我们之前使用过的多个评估。我们包括了对用户福祉的新评估、对模型拒绝潜在危险请求能力的更复杂测试,以及对模型秘密进行有害行为能力的更新评估。我们还尝试了来自可解释性的新方法,即 AI 模型内部工作原理的科学,以开始理解模型为什么以某种方式行动——最终是为了捕获标准测试可能遗漏的问题。
所有功能和安全评估的详细描述可在 Claude Opus 4.6 系统卡片中获得。
我们还在 Opus 4.6 显示特别强项可能被危险使用以及有益使用的领域应用了新的安全保护措施。特别是,由于该模型展示了增强的网络安全能力,我们开发了六个新的网络安全探针——检测有害响应的方法——以帮助我们跟踪不同形式的潜在滥用。
我们也在加速模型的网络防御用途,用它来帮助发现和修补开源软件中的漏洞(如我们在新的网络安全博客文章中所描述的)。我们认为网络防御者使用像 Claude 这样的 AI 模型来帮助扳平竞争环境至关重要。网络安全发展迅速,我们将根据了解到的潜在威胁调整和更新我们的保护措施;在不久的将来,我们可能会采用实时干预来阻止滥用。
我们在 Claude、Claude Code 和 Claude 平台上进行了大幅更新,以让 Opus 4.6 达到最佳性能。
在 API 上,我们为开发者提供了对模型工作量的更好控制和对长时间运行 Agent 的更大灵活性。为此,我们引入了以下功能:
自适应思考。之前,开发者只能在启用或禁用扩展思考之间进行二元选择。现在,通过自适应思考,Claude 可以决定何时更深入的推理会有所帮助。在默认工作量级别(高)下,模型在有用时使用扩展思考,但开发者可以调整工作量级别,使其更或更少地选择。
工作量。现在有四个工作量级别可供选择:低、中、高(默认)和最高。我们鼓励开发者尝试不同的选项,找到最适合的。
上下文压缩(beta)。长时间运行的对话和 Agent 任务经常会突破上下文窗口。上下文压缩自动总结和替换较旧的上下文,当对话接近可配置的阈值时,让 Claude 执行更长的任务而不突破限制。
1M token 上下文(beta)。Opus 4.6 是我们首个具有 1M token 上下文的 Opus 级模型。对于超过 200k token 的提示(每百万 input/output token 为 10 美元/37.50 美元),高级定价适用,仅在 Claude 平台上可用。
128k 输出 token。Opus 4.6 支持最多 128k token 的输出,让 Claude 完成更大的输出任务而无需将其分解为多个请求。
仅限美国推理。对于需要在美国运行的工作负载,仅限美国推理可以按 1.1 倍 token 定价提供。
在 Claude 和 Claude Code 中,我们添加了功能,使知识工作者和开发者能够用他们每天使用的更多工具处理更难的任务。
我们在 Claude Code 中作为研究预览引入了 Agent 团队。你现在可以启动多个并行工作作为团队并自主协调的 Agent——最适合分解为独立、读取密集型工作的任务,如代码库审查。你可以使用 Shift+Up/Down 或 tmux 直接接管任何子 Agent。
Claude 现在还能更好地与你已经使用的办公工具配合使用。Claude in Excel 用改进的性能处理长时间运行和更难的任务,并可以在行动前计划、摄入非结构化数据并在无需指导的情况下推断正确的结构,以及在一次通过中处理多步更改。将其与 Claude in PowerPoint 配合使用,你可以首先在 Excel 中处理和结构化你的数据,然后在 PowerPoint 中将其可视化呈现。Claude 读取你的布局、字体和幻灯片主版本以保持品牌风格,无论你是从模板构建还是从描述生成完整的演示文稿。Claude in PowerPoint 现在在 Max、Team 和 Enterprise 计划的研究预览中提供。
[1] 1M token 上下文窗口目前在 Claude 开发者平台的 beta 阶段提供。
[2] 由人工智能分析独立运行。完整的方法论细节见此处。
[3] 这意味着 Claude Opus 4.6 在此评估上获得比 GPT-5.2 更高分数的时间约为 70%(50% 时间意味着分数相当)。
对于 GPT-5.2 和 Gemini 3 Pro 模型,我们比较了图表和表格中报告的最佳模型版本。
Terminal-Bench 2.0:我们报告了在我们的基础设施上重现的分数和其他实验室发布的分数。除了 OpenAI 的 Codex CLI 外,所有运行都使用了 Terminus-2 工具。所有实验使用 1× 保证/3× 上限资源分配和跨分散批次每个任务 5-15 个样本。详见系统卡片。
Humanity's Last Exam:使用工具运行的 Claude 模型配备了网络搜索、网络获取、代码执行、程序化工具调用、在 50k token 处触发的上下文压缩(最多 3M 总 token)、最大推理工作量和自适应思考启用。使用域名黑名单来对评估结果进行去污染处理。详见系统卡片了解更多详情。
SWE-bench Verified:我们的分数是 25 次试验的平均值。通过提示修改,我们看到了 81.42% 的分数。
MCP Atlas:Claude Opus 4.6 在最高工作量下运行。当以高工作量运行时,它达到了 62.7% 的行业领先分数。
BrowseComp:Claude 模型配备了网络搜索、网络获取、程序化工具调用、在 50k token 处触发的上下文压缩(最多 10M 总 token)、最大推理工作量和无思考启用。添加多 Agent 工具增加了分数至 86.8%。详见系统卡片了解更多详情。
ARC AGI 2:Claude Opus 4.6 在最高工作量和 120k 思考预算分数下运行。
CyberGym:Claude 模型在无思考、默认工作量、温度和 top_p 下运行。该模型还被给予了一个"思考"工具,允许对多轮评估进行交错思考。
OpenRCA:对于 OpenRCA 中的每个失败情况,如果所有生成的根本原因元素都与ground-truth 相匹配,Claude 获得 1 分,如果任何不匹配,则获得 0 分。总体准确度是所有失败情况的平均分数。基准在基准作者的工具上运行,使用其官方方法评分,并已提交以供官方验证。
[2026 年 2 月 23 日] 更新了 Opus 4.6 for HLE with tools 的报告分数(53.1% 至 53.0%)。此更新是由于运行改进的作弊检测管道而引起的,该管道标记了我们原始管道遗漏的 3 个额外作弊实例。
Cognizant 和 Anthropic 扩展合作伙伴关系,为企业客户提供 Claude
Opus 5 是 Opus 级的质的改进,为长时间运行的 Agent 提供支持,同时在编码和专业工作中提供改进。