Claude Opus 4.7 重磅发布:年度重量级模型升级
Anthropic 发布 Claude Opus 4.7,在代码、推理等能力上大幅提升,社区 1959 点赞和 1452 条讨论创新高。
Anthropic 发布 Claude Opus 4.7,在代码、推理等能力上大幅提升,社区 1959 点赞和 1452 条讨论创新高。
我们最新的模型 Claude Opus 4.7 现已普遍可用。
Opus 4.7 相比 Opus 4.6 在高级软件工程方面有显著改进,尤其在最具挑战性的任务上有明显提升。用户表示能够放心地将最困难的编码工作——那种以前需要密切监督的工作——交给 Opus 4.7 处理。Opus 4.7 能够以严谨和一致的方式处理复杂、长时间运行的任务,对指令的执行精准无误,并会想办法在报告结果前验证自己的输出。
该模型在视觉能力上也有显著改进:它可以以更高分辨率查看图像。在完成专业任务时更具品味和创意,能生成更高质量的界面、演示文稿和文档。虽然它的综合能力不如我们最强大的模型 Claude Mythos Preview,但在一系列基准测试中的表现优于 Opus 4.6:
上周我们宣布了 Project Glasswing,强调了 AI 模型在网络安全方面的风险和益处。我们表示,会将 Claude Mythos Preview 的发布限制在一定范围内,并首先在能力较弱的模型上测试新的网络安全防护措施。Opus 4.7 是这样的第一个模型:其网络安全能力不如 Mythos Preview 先进(实际上,在其训练过程中,我们尝试了有差异地降低这些能力的方法)。我们发布 Opus 4.7 时配备了防护措施,可以自动检测并阻止表明被禁止或高风险网络安全用途的请求。从这些防护措施的真实部署中我们学到的经验,将帮助我们为最终目标——广泛发布 Mythos 级别的模型——而努力。
希望将 Opus 4.7 用于合法网络安全目的(例如漏洞研究、渗透测试和红队测试)的安全专业人士可以加入我们新推出的网络验证计划。
Opus 4.7 从今天起在所有 Claude 产品和我们的 API、Amazon Bedrock、Google Cloud 的 Vertex AI 以及 Microsoft Foundry 上可用。定价与 Opus 4.6 相同:每百万输入 token 5 美元,每百万输出 token 25 美元。开发者可以通过 Claude API 使用 claude-opus-4-7。
Claude Opus 4.7 从我们的早期测试者那里获得了很强的反馈:
以下是我们对 Opus 4.7 早期测试的一些亮点和注记:
指令遵循。Opus 4.7 在遵循指令方面有显著改进。有趣的是,这意味着为早期模型编写的 prompt 有时会产生意外的结果:而之前的模型会松散地解释指令或跳过部分内容,Opus 4.7 会按字面意思理解指令。用户应该相应地重新调整他们的 prompt 和工具。
改进的多模态支持。Opus 4.7 对高分辨率图像有更好的视觉能力:它可以接受长边最多 2,576 像素的图像(约 375 万像素),比之前的 Claude 模型多三倍以上。这为依赖精细视觉细节的多模态用途打开了大门:计算机使用 agent 读取密集的屏幕截图、从复杂图表中进行数据提取,以及需要像素级精准参考的工作。1
真实工作。除了在财务代理评估中获得最先进的分数(见上表)外,我们的内部测试表明 Opus 4.7 是比 Opus 4.6 更有效的财务分析师,能生成严谨的分析和模型、更专业的演示文稿,以及跨任务的更紧密集成。Opus 4.7 在 GDPval-AA 上也是最先进的,这是一个第三方评估,涵盖财务、法律和其他领域的经济价值知识工作。
内存。Opus 4.7 在使用基于文件系统的内存时表现更好。它能在长期的多会话工作中记住重要的笔记,并将它们用于需要较少前期语境的新任务。
下面的图表展示了我们发布前测试中来自各个不同领域的更多评估结果:
总体而言,Opus 4.7 的安全性评测与 Opus 4.6 相似:我们的评估表明欺骗、拍马屁和配合滥用等令人担忧的行为比率很低。在某些方面,如诚实性和抵抗恶意"prompt 注入"攻击的能力上,Opus 4.7 相比 Opus 4.6 有所改进;而在其他方面(如提供过于详细的管制物质伤害减少建议的倾向),Opus 4.7 略有逊色。我们的对齐评估得出结论,该模型"大体上对齐良好且值得信任,但在行为上不完全理想"。请注意,根据我们的评估,Mythos Preview 仍是我们训练过的对齐最好的模型。我们的安全评估在 Claude Opus 4.7 系统卡中详细讨论。
除了 Claude Opus 4.7 本身,我们还推出了以下更新:
更多的效力控制:Opus 4.7 引入了一个新的 xhigh("超高")效力级别,介于 high 和 max 之间,让用户对难问题的推理和延迟之间的权衡有更精细的控制。在 Claude Code 中,我们将所有计划的默认效力级别提升到了 xhigh。在测试 Opus 4.7 的编码和 agent 用例时,我们建议从 high 或 xhigh 效力级别开始。
在 Claude 平台(API)上:除了支持更高分辨率的图像外,我们还在公测中推出了任务预算,使开发者能够引导 Claude 的 token 支出,以便在更长的运行中优先处理工作。
在 Claude Code 中:新的 /ultrareview 斜杠命令会生成一个专门的审核会话,阅读更改并标记细心审核者会发现的错误和设计问题。我们为 Pro 和 Max Claude Code 用户提供三次免费 ultrareview 使用机会来尝试。此外,我们还向 Max 用户扩展了自动模式。自动模式是一个新的权限选项,其中 Claude 代表你做出决定,这意味着你可以在更少中断的情况下运行更长的任务——风险也比你选择跳过所有权限时更低。
Opus 4.7 是 Opus 4.6 的直接升级,但有两个值得规划的变化,因为它们会影响 token 使用量。首先,Opus 4.7 使用了更新的分词器,改进了模型处理文本的方式。折衷是相同的输入可能映射到更多 token——大约 1.0–1.35× 倍,具体取决于内容类型。其次,Opus 4.7 在更高的效力级别(特别是在 agent 设置中的后期轮次)上思考更多。这改进了它在难问题上的可靠性,但这确实意味着它会产生更多的输出 token。
用户可以通过多种方式控制 token 使用:使用效力参数、调整任务预算,或提示模型更简洁。在我们自己的测试中,净效果是有利的——在内部编码评估中,所有效力级别的 token 使用得到了改进,如下所示——但我们建议在真实流量上衡量差异。我们编写了一份迁移指南,提供了有关从 Opus 4.6 升级到 Opus 4.7 的进一步建议。
1 这是模型级别的变化而非 API 参数,所以用户发送给 Claude 的图像将简单地以更高保真度处理。由于更高分辨率的图像消耗更多 token,不需要额外细节的用户可以在发送图像前对其进行下采样。
对于 GPT-5.4 和 Gemini 3.1 Pro,我们比较了通过 API 可获得的最佳报告模型版本。
MCP-Atlas:Opus 4.6 的分数已更新以反映来自 Scale AI 的修订评分方法。
SWE-bench Verified、Pro 和 Multilingual:我们的记忆筛选标记了这些 SWE-bench 评估中的一些问题。排除任何显示记忆迹象的问题,Opus 4.7 相对 Opus 4.6 的改进幅度仍然成立。
Terminal-Bench 2.0:我们使用了 Terminus-2 工具,禁用了思考。所有实验使用了 1× 保证/3× 上限资源分配,在每个任务上平均进行了五次尝试。
CyberGym:Opus 4.6 的分数已从原始报告的 66.6 更新为 73.8,因为我们更新了工具参数以更好地引出网络安全能力。
SWE-bench Multimodal:我们为 Opus 4.7 和 Opus 4.6 都使用了内部实现。分数不能直接与公共排行榜分数比较。
2026 年 5 月 4 日:更新了文档推理图以反映 Opus 4.7 的更新 OfficeQA Pro 分数。
Cognizant 和 Anthropic 扩展合作伙伴关系,为企业客户带来 Claude
Opus 5 是 Opus 级别的一次质的飞跃,在推动长期运行 agent 的同时,在编码和专业工作方面也有改进。