Claude Opus 5 发布:重大能力升级
Anthropic 发布下一代旗舰模型 Claude Opus 5,功能和推理能力显著提升,预期改变 AI 编程工作流。
Anthropic 发布下一代旗舰模型 Claude Opus 5,功能和推理能力显著提升,预期改变 AI 编程工作流。
Claude Opus 5 已于今日推出。这是一个深思熟虑且富有主动性的模型,性能接近 Claude Fable 5 的前沿水平,但价格仅为其一半。
在编码和知识工作评估(如 Frontier-Bench 和 GDPval-AA)中,Opus 5 是新的业界最佳,但在网络安全任务上仍落后于 Mythos 5。
Opus 5 设计用于日常使用:它的工作效率比其他模型更高。它是 Claude Max 上的新默认模型,也是 Claude Pro 上最强大的模型。
Claude Opus 5 在与前代产品 Opus 4.8 相同的成本下提供了大幅改进的性能。本节中的图表展示了性能如何根据模型的努力设置而变化,客户可以使用努力设置来优化智能程度或节省 token 以获得更快更便宜的结果。
Opus 5 在有价值的软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 上,Opus 5 超越所有其他模型,以更低的每任务成本使 Opus 4.8 的性能翻倍。在 CursorBench 3.2 上,在最大努力设置下,该模型的性能在 Fable 5 最佳成绩的 0.5% 以内,但每任务成本仅为其一半;它还在高、超高和最大努力设置下,以给定成本实现了比所有其他模型更好的性能。
我们在知识工作和问题解决任务上看到了类似的结果。例如:
在 ARC-AGI 3 上(一个模型必须解决新奇问题的评估),Opus 5 的得分是次佳模型的三倍。
在 Zapier AutomationBench 上(衡量模型能否从始至终完成业务任务),Opus 5 的通过率约为次佳模型的 1.5 倍(相同成本下)。即使在最低努力设置下,Opus 5 也通过了比任何其他模型更多的任务。
在 OSWorld 2.0 上(一个计算机使用基准),Opus 5 在任何给定成本下都优于所有其他模型,以仅超过三分之一的成本超越了 Fable 5 的最佳结果。
在多项相关评估上,它也是我们最好且最具成本效益的模型:
Opus 5 相对于 Opus 4.8 在科学研究上有了显著改进。在我们所有生命科学评估上的表现都超过了 Opus 4.8,这些评估涵盖结构生物学、有机化学和生物信息学等主题。其改进在有机化学任务上最为显著,例如从光谱数据推断分子结构(在我们内部基准上得分比 Opus 4.8 高 10.2 个百分点),以及预测蛋白质序列变化如何影响其功能等与蛋白质相关的任务(此处得分高 7.7 个百分点)。
最后,Opus 5 能够生成强大得多的视觉输出:
Claude Opus 5 在验证其工作和仔细迭代直到成功方面强大得多。在评估和早期测试中,我们和用户发现了许多 Opus 5 的主动性和彻底性的例子:
在一个 Frontier-Bench 任务中,Opus 5 被给予了一个机器零件的图纸,并被要求编写代码将其重建为 3D FreeCAD 模型。然而,在这个任务中,模型被故意没有给予直接查看图纸的方式。Opus 5 通过编写自己的计算机视觉管道来从原始像素中提取几何形状,然后重建了完整的机器零件来应对。它成功地多次完成了这项任务;没有竞争对手模型在相同设置下能在五次尝试后解决它。
在一个流行的开源包管理器中存在真实 bug 的情况下,Opus 5 找到了根本原因,并修复了社区补丁所遗漏的边缘情况。竞争对手模型仅修复了表面症状(而非根本原因),然后报告 bug 已解决。
一家交易公司的工程师使用 Opus 5 在一个会话中为一个新交易所构建了市场数据源。之前的模型无法完成此任务,即使得到了工程师的广泛计划。由于找不到实时源来验证,Opus 5 甚至构建了自己的测试框架来检查其代码是否正确解析了交易所的数据。
以下是我们早期测试客户对使用 Opus 5 体验的进一步报告:
对齐性。在部署前测试中,我们的自动化行为审计发现 Opus 5 是迄今为止与 Claude 宪法最匹配的模型(如下图所示)。它比 Opus 4.8、Sonnet 5 或 Fable 5 更好地遵守 Claude 的宪法;表现出最低的欺骗行为率;最难被诱骗进行滥用。在避免可能产生难以逆转副作用的鲁莽行为方面,它也是我们迄今最安全的模型。
安全性。Opus 5 不会推进高风险的双用途能力边界。在与私营部门和政府合作伙伴进行的严格评估中,我们发现它在生物学研究和攻击性网络安全方面都落后于 Mythos 5。有关这些评估的更多信息可在我们的系统卡中找到。
与其前代产品 Opus 4.8 一样,我们有意避免在网络安全任务上训练 Opus 5。然而,由于模型变得更具通用能力,该模型在这些任务上有了实质性改进,并且在发现网络安全漏洞方面已接近 Mythos 5。但在这些漏洞的利用上(即将漏洞转化为实质性网络威胁)仍远落后于 Mythos 5。
这通过 Opus 5 在 OSS-Fuzz 上的表现得到了说明,OSS-Fuzz 是我们开发的一项评估,用于评估模型在没有广泛人类指导的情况下发现和利用漏洞的能力。虽然 Mythos 5 和 Opus 5 识别漏洞的成功率相似,但 Opus 5 在漏洞利用开发上的得分远低于 Mythos 5。
Claude Opus 5 的安全措施旨在允许该模型在网络安全和生物学中的有益用途。这些措施与我们应用于 Opus 4.8 的措施相似,只是在一小部分网络安全任务上有了一些更强的护栏。
网络安全。Opus 5 的网络安全分类器的限制性相对低于 Fable 5。它们允许 Opus 5 在源代码中发现漏洞,但阻止"基于二进制"的漏洞扫描(一种更可能与恶意行为者相关联的方法)、渗透测试和漏洞利用生成。
根据我们的测试,我们预期分类器的干预频率比 Fable 5 少约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求将默认回退到 Opus 4.8。在 API 上也可以启用回退到 Opus 4.8。
我们的网络安全验证计划(CVP)促进了那些在模型安全措施下可能受阻的网络安全工作。已经是 CVP 一部分的企业和研究人员可以立即访问安全限制较少的 Opus 5 版本。
生物学。由于 Opus 5 具有与 Opus 4.8 相似的安全措施套件,它现在是我们面向科学研究最有能力的通用模型。尽管如此,该模型在长期运行的自主研究任务上仍然表现出重要的局限性,这是我们预期 AI 模型会带来最大生物学相关风险的地方。(Mythos 5 仍然是这类生物学工作的更强模型。)作为此次发布的一部分,在 Fable 5 上被阻止的生物学相关请求现在将路由到 Opus 5 而非 Opus 4.8。
Claude Opus 5 从今天起在所有平台上可用,定价为每百万输入 token 5 美元,每百万输出 token 25 美元(与 Opus 4.8 相同)。开发者可以在 Claude API 上使用 claude-opus-5 开始使用。
它也提供快速模式,运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,快速模式在 Claude 平台上的价格为 Opus 5 基础价格的两倍,也可以通过 Claude Code 的使用额度获得。
随着 Opus 5 的推出,我们还发布了两项测试版更新:
对话中工具更改。在对话中,开发者现在可以改变 Claude 可以使用的工具,而无需使 prompt 缓存失效。
API 自动回退。用户现在可以选择让被我们安全分类器在 Opus 5(或 Fable 5)上标记的请求自动路由到另一个模型。启用自动回退后,API 请求将默认路由到最佳可用模型,而不是被阻止。
与之前的 Opus 模型一致,Opus 5 对于通用访问没有数据保留要求。
有关如何充分利用 Opus 5 的更多指导,请查看我们的 prompt 指南。
Frontier-Bench v0.1,努力图表:这些结果来自 Frontier-Bench v0.1 的内部运行,在 mini-SWE-agent 框架和 GKE 后端上,每个任务的 5 次尝试的平均奖励。Opus 4.8 在 Opus 5 和 Fable 5 的安全分类器拒绝时充当回退。
Cognizant 和 Anthropic 扩展合作伙伴关系,为企业客户提供 Claude
经济未来研究基金研究议程
我们正在分享 Anthropic 经济未来研究基金的研究议程。