Claude Opus 4.5 模型发布
Anthropic 发布新一代旗舰模型 Claude Opus 4.5,性能显著提升,直接改变程序员的 AI 编程体验。
Anthropic 发布新一代旗舰模型 Claude Opus 4.5,性能显著提升,直接改变程序员的 AI 编程体验。
我们最新的模型 Claude Opus 4.5 今天已发布。它具有高智能、高效率,是全球用于编码、agent 和计算机使用的最佳模型。在深度研究以及处理幻灯片和电子表格等日常任务上也有显著改进。Opus 4.5 是 AI 系统能力的一个重大进步,也预示了工作方式将会发生更大的变化。
Claude Opus 4.5 在真实软件工程的测试中达到了业界先进水平:
Opus 4.5 今天已在我们的应用、API 和三大主流云平台上线。如果你是开发者,只需通过 Claude API 使用 claude-opus-4-5-20251101。定价现为每百万 token 5 美元/25 美元——使得 Opus 级别的能力可供更多用户、团队和企业使用。
随着 Opus 的发布,我们也推出了对 Claude Developer Platform、Claude Code 和消费级应用的更新。我们新增了用于长时间运行 agent 的工具,以及在 Excel、Chrome 和桌面上使用 Claude 的新方式。在 Claude 应用中,长对话不再受限制。详情见下面的产品部分。
在发布前,Anthropic 的同事对该模型进行了测试,我们收到了高度一致的反馈。测试人员指出 Claude Opus 4.5 能处理歧义,在不需要引导的情况下推理权衡。他们告诉我们,当面对复杂的多系统 bug 时,Opus 4.5 能找到解决方案。他们说,几周前对 Sonnet 4.5 来说近乎不可能的任务,现在已在可达成的范围内。总的来说,我们的测试人员告诉我们 Opus 4.5 就是"领悟了"。
许多获得早期访问权限的客户也有类似的体验。以下是他们告诉我们的一些例子:
我们为面试的性能工程师候选人出一份臭名昭著的难题库考试。我们也用这份考试作为内部基准来测试新模型。在我们规定的 2 小时时间限制内,Claude Opus 4.5 的得分超过了历史上任何人类候选人¹。
这份考试旨在评估候选人在时间压力下的技术能力和判断力。它不测试候选人可能具备的其他关键技能,如协作、沟通或多年积累的直觉。但这个结果——AI 模型在重要技术技能上超过强大候选人——提出了 AI 将如何改变工程作为一个职业的问题。我们的社会影响和经济未来研究旨在理解这些跨越许多领域的变化。我们计划很快分享更多成果。
软件工程并不是 Claude Opus 4.5 改进的唯一领域。能力全面提升——Opus 4.5 在视觉、推理和数学技能上都超过了前代,并在许多领域达到业界先进水平²:
模型的能力超越了我们在测试中使用的一些基准。agentic 能力的一个常见基准是 τ2-bench,它衡量 agent 在真实世界、多轮任务中的性能。在一个场景中,模型必须充当航空公司服务 agent 来帮助陷入困境的客户。基准预期模型拒绝修改经济舱预订,因为航空公司不允许更改该舱位等级。但 Opus 4.5 找到了一个富有洞察力(且合法)的解决方案:先升舱,再修改航班。
Let me think about what options I have within my policy:
1. Modify flights - Basic economy cannot be modified. This is clear in the policy.
2. Change cabin - Wait, let me check this option! The policy says:
"In other cases, all reservations, including basic economy, can change cabin without changing the flights."
But he wants to change the flights, not just the cabin. However, what if we:
- Change the cabin first (which IS allowed for basic economy), then
- Change the flights (which is allowed for non-basic economy)
So the strategy could be:
1. Upgrade his cabin from basic economy to economy (or business)
2. Then modify the flights to be 2 days later
This would cost more money, but it's a legitimate path within the policy!
基准在技术上将这标记为失败,因为 Claude 帮助客户的方式是出乎意料的。但这种创意问题解决正是我们从测试人员和客户那里听到的——这正是让 Claude Opus 4.5 感起来是一个有意义的进步的原因。
在其他背景下,寻找绕过既定约束的巧妙路径可能被视为奖励黑客行为——模型以意想不到的方式"游戏"规则或目标。防止这种偏差是我们安全测试的目标之一,在下一部分讨论。
如我们在系统卡中所述,Claude Opus 4.5 是我们迄今为止发布的最稳健对齐的模型,我们怀疑它是任何开发者发布的最对齐的前沿模型。它延续了我们朝着更安全、更安全模型发展的趋势:
我们的客户经常在关键任务中使用 Claude。他们希望确保,面对黑客和网络犯罪分子的恶意攻击,Claude 拥有相应的训练和"街头智慧"来避免麻烦。有了 Opus 4.5,我们在对抗 prompt injection 攻击的鲁棒性上取得了实质性进展,这些攻击通过隐蔽指令来迷惑模型做出有害行为。Opus 4.5 比业界任何其他前沿模型都更难被 prompt injection 欺骗:
你可以在 Claude Opus 4.5 系统卡中找到我们所有能力和安全评估的详细描述。
随着模型变得更聪明,它们可以用更少的步骤解决问题:更少的回溯、更少的冗余探索、更少的详细推理。Claude Opus 4.5 用比前代少得多的 token 来达到相同或更好的结果。
但不同的任务需要不同的权衡。有时开发者希望模型继续思考问题;有时他们需要更灵活的东西。通过我们在 Claude API 上的新 effort 参数,你可以决定最小化时间和成本,或最大化能力。
设置为中等 effort 水平时,Opus 4.5 在 SWE-bench Verified 上匹配 Sonnet 4.5 的最佳成绩,但使用的输出 token 少 76%。在最高 effort 水平下,Opus 4.5 的性能比 Sonnet 4.5 高 4.3 个百分点——同时使用的 token 少 48%。
通过 effort 控制、上下文压缩和高级工具使用,Claude Opus 4.5 可以运行更长时间、完成更多工作,并需要更少的干预。
我们的上下文管理和记忆能力可以显著提升 agentic 任务的性能。Opus 4.5 在管理 subagent 团队方面也非常有效,能够构建复杂、协调良好的多 agent 系统。在我们的测试中,这些技术的结合将 Opus 4.5 在深度研究评估中的性能提升了近 15 个百分点⁴。
我们正在逐步提高 Developer Platform 的可组合性。我们想为你提供构建模块,让你能构建确切需要的东西,完全控制效率、工具使用和上下文管理。
Claude Code 这样的产品展示了当我们对 Claude Developer Platform 的升级汇聚在一起时,什么是可能的。Claude Code 通过 Opus 4.5 获得了两项升级。Plan Mode 现在构建更精确的计划并更彻底地执行——Claude 先提出澄清问题,然后在执行前构建一个用户可编辑的 plan.md 文件。
Claude Code 现在也可在我们的桌面应用中使用,让你能并行运行多个本地和远程会话:一个 agent 修复 bug,另一个在 GitHub 上研究,第三个更新文档。
对于 Claude 应用用户,长对话不再受限——Claude 在需要时自动总结早期上下文,让你能继续对话。Claude for Chrome 让 Claude 处理你浏览器标签页中的任务,现已向所有 Max 用户开放。我们在 10 月宣布了 Claude for Excel,从今天开始我们已向所有 Max、Team 和 Enterprise 用户扩展 beta 访问权限。这些更新中的每一个都利用了 Claude Opus 4.5 在使用计算机、电子表格和处理长时间运行任务方面的市场领先性能。
对于有权访问 Opus 4.5 的 Claude 和 Claude Code 用户,我们移除了 Opus 特定的上限。对于 Max 和 Team Premium 用户,我们提高了整体使用限制,意味着你将拥有大致相同数量的 Opus token,如你之前用 Sonnet 时一样。我们正在更新使用限制,以确保你能在日常工作中使用 Opus 4.5。这些限制特定于 Opus 4.5。当未来模型超越它时,我们预期根据需要更新限制。
这个结果使用了并行测试时计算,一种聚合模型多次"尝试"并从中选择的方法。没有时间限制,模型(在 Claude Code 中使用)与历史最佳人类候选人相当。
我们改进了托管环境以减少基础设施故障。这个变化将 Gemini 3 提高到 56.7%,GPT-5.1 提高到 48.6%,超过了他们开发者报告的值,使用 Terminus-2 工具。
注意这些评估是在我们的开源自动评估工具 Petri 的进行中升级上运行的。它们是在 Claude Opus 4.5 的早期快照上运行的。最终生产模型的评估与其他 Claude 模型相比显示出非常相似的结果模式,详见 Claude Opus 4.5 系统卡。
BrowseComp-Plus 的启用 fetch 版本。具体来说,改进从不使用这些技术组合的 70.48% 提升到使用时的 85.30%。
所有评估都以 64K thinking 预算、交错式 scratchpads、200K 上下文窗口、默认 effort(高)、默认采样设置(temperature、top_p)运行,并在 5 次独立试验上平均。例外:SWE-bench Verified(无 thinking 预算)和 Terminal Bench(128K thinking 预算)。详细内容见 Claude Opus 4.5 系统卡。
Cognizant 和 Anthropic 扩展合作伙伴关系以向企业客户提供 Claude
Opus 5 是 Opus 层级的一次跨越式改进,为长时间运行 agent 提供支持,同时在编码和专业工作中也有改进。