Claude 4 正式发布
Anthropic 发布下一代旗舰模型 Claude 4,在编程、分析、推理等维度大幅提升,会直接改变开发工作方式。
Anthropic 发布下一代旗舰模型 Claude 4,在编程、分析、推理等维度大幅提升,会直接改变开发工作方式。
今天,我们推出了下一代 Claude 模型:Claude Opus 4 和 Claude Sonnet 4,为编码、高级推理和 AI Agent 设立了新的标准。
Claude Opus 4 是世界上最好的编码模型,在复杂、长时间运行的任务和 Agent 工作流上具有稳定的性能。Claude Sonnet 4 是对 Claude Sonnet 3.7 的重大升级,提供卓越的编码和推理能力,同时对你的指令作出更精确的响应。
除了模型本身,我们还宣布:
Extended thinking 与工具使用(测试版):两个模型都可以在 extended thinking 期间使用工具(如网页搜索),使 Claude 能够在推理和工具使用之间交替,从而改进响应。
新的模型能力:两个模型都可以并行使用工具、更精确地遵循指令,并且当开发者提供本地文件访问时,会展示显著改进的内存能力,提取和保存关键事实以保持连贯性并随时间积累隐性知识。
Claude Code 正式推出:在研究预览期间获得广泛积极反馈后,我们扩展了开发者与 Claude 协作的方式。Claude Code 现在支持通过 GitHub Actions 的后台任务,以及与 VS Code 和 JetBrains 的原生集成,在你的文件中直接显示编辑内容,实现无缝的配对编程。
新的 API 能力:我们在 API 上发布了四项新能力,使开发者能够构建更强大的 AI Agent:代码执行工具、MCP 连接器、Files API,以及将提示词缓存长达一小时的能力。
Claude Opus 4 和 Sonnet 4 是混合模型,提供两种模式:近乎即时的响应和用于深度推理的 extended thinking。Pro、Max、Team 和 Enterprise Claude 计划包括两个模型和 extended thinking,Sonnet 4 也可供免费用户使用。两个模型都可在我们的 API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 上获得。定价与之前的 Opus 和 Sonnet 模型保持一致:Opus 4 为 $15/$75(每百万 token 的输入/输出),Sonnet 4 为 $3/$15。
Claude Opus 4 是我们迄今最强大的模型,也是世界上最好的编码模型,在 SWE-bench 上领先(72.5%)和 Terminal-bench 上领先(43.2%)。它在需要专注力和数千个步骤的长时间运行任务上提供稳定的性能,能够连续工作数小时,远超所有 Sonnet 模型,并显著扩展了 AI Agent 能够完成的工作范围。
Claude Opus 4 在编码和复杂问题求解方面表现卓越,驱动前沿的 Agent 产品。Cursor 称其为编码的最先进水平,在复杂代码库理解上是一个飞跃。Replit 报告说它在多文件的复杂更改上提高了精确度并取得了显著进展。Block 称其为第一个在其 Agent(代号 goose)中边编辑边调试时提高代码质量的模型,同时保持了完整的性能和可靠性。Rakuten 通过一个耗时 7 小时、独立运行的开源重构验证了其能力,展现了持续的性能。Cognition 指出 Opus 4 擅长解决其他模型无法处理的复杂难题,成功处理了之前模型遗漏的关键操作。
Claude Sonnet 4 在 Sonnet 3.7 的业界领先能力基础上有了显著改进,在编码方面表现出色,在 SWE-bench 上达到最先进的 72.7%。该模型在内部和外部用例中平衡了性能和效率,增强了可操控性以更好地控制实现细节。虽然在大多数领域不及 Opus 4,但它提供了能力和实用性的最优组合。
GitHub 表示 Claude Sonnet 4 在 Agent 场景中表现突出,并将其作为 GitHub Copilot 新编码 Agent 的驱动模型。Manus 强调了其在遵循复杂指令、清晰推理和美观输出方面的改进。iGent 报告说 Sonnet 4 在自主多功能应用开发方面表现出色,并在问题求解和代码库导航方面有了实质性改进,将导航错误从 20% 降低到接近零。Sourcegraph 表示该模型显示出在软件开发方面有实质性飞跃的潜力——更长时间地保持正轨、更深入地理解问题、提供更优雅的代码质量。Augment Code 报告说成功率更高、代码编辑更精确、在复杂任务中工作更谨慎,使其成为主要模型的首选。
这些模型推进了我们客户整体的 AI 战略:Opus 4 在编码、研究、写作和科学发现上突破边界,而 Sonnet 4 作为从 Sonnet 3.7 的直接升级,为日常用例带来了前沿性能。
除了 extended thinking 与工具使用、并行工具执行和内存改进之外,我们还显著减少了模型使用快捷方式或漏洞来完成任务的行为。在特别容易被快捷方式和漏洞利用的 Agent 任务上,两个模型比 Sonnet 3.7 从事此类行为的可能性低 65%。
Claude Opus 4 还在内存能力上大幅超越所有之前的模型。当开发者构建提供 Claude 本地文件访问的应用时,Opus 4 变得擅长创建和维护"内存文件"来存储关键信息。这开启了更好的长期任务感知、连贯性和 Agent 任务的性能——比如 Opus 4 在玩 Pokémon 时创建"导航指南"。
最后,我们为使用较小模型来浓缩冗长思考过程的 Claude 4 模型引入了思考总结。这种总结只需要在约 5% 的时间进行——大多数思考过程足够短可以完整显示。需要原始思考链条用于高级提示工程的用户可以联系销售了解我们新的开发者模式以保持完整访问。
Claude Code 正式推出了,将 Claude 的力量带给你更多开发工作流——在终端、你最喜欢的 IDE 中,以及通过 Claude Code SDK 在后台运行。
VS Code 和 JetBrains 的新测试版扩展将 Claude Code 直接集成到你的 IDE 中。Claude 建议的编辑以内联方式出现在你的文件中,简化了评审和在熟悉编辑器界面内的跟踪。只需在你的 IDE 终端运行 Claude Code 即可安装。
除了 IDE,我们发布了一个可扩展的 Claude Code SDK,因此你可以使用与 Claude Code 相同的核心 Agent 来构建你自己的 Agent 和应用。我们也发布了 SDK 可能做到的事情的一个示例:Claude Code on GitHub,现在处于测试版。在 PR 上标签标记 Claude Code,以响应评审者反馈、修复 CI 错误或修改代码。要安装,在 Claude Code 内运行 /install-github-app。
这些模型是向虚拟协作者迈进的一大步——保持完整的上下文、在更长的项目上保持专注、驱动变革性影响。它们附带广泛的测试和评估以最小化风险并最大化安全,包括实施更高 AI 安全级别(如 ASL-3)的措施。
我们很期待看到你将创建什么。立即在 Claude、Claude Code 或你选择的平台上开始。
一如既往,你的反馈帮助我们改进。
Claude Opus 4 和 Sonnet 4 是混合推理模型。本博文中报告的基准测试显示使用或不使用 extended thinking 实现的最高分数。我们在下方为每个结果注明了是否使用了 extended thinking:
无 extended thinking:SWE-bench Verified、Terminal-bench
Extended thinking(最多 64K token):
分数是通过向 Airline 和 Retail Agent Policy 两者添加提示词补充来实现的,指导 Claude 在使用 extended thinking 与工具使用时更好地利用其推理能力。在多轮轨迹期间,模型被鼓励像解决问题一样写下其思想,与我们常规思考模式不同,以最好地利用其推理能力。为了容纳 Claude 通过使用更多思考而产生的额外步骤,最大步骤数(按模型完成次数计算)从 30 增加到 100(大多数轨迹在 30 步内完成,仅一个轨迹超过 50 步)。
对于 Claude 4 系列模型,我们继续使用相同的简单脚手架,仅为模型配备我们之前发布中描述的两个工具——bash 工具和通过字符串替换运行的文件编辑工具。我们不再包括 Claude 3.7 Sonnet 使用的第三个"规划工具"。在所有 Claude 4 模型上,我们报告的分数来自全部 500 个问题。OpenAI 模型的分数报告来自 477 个问题的子集。
对于我们的"高计算"数字,我们采纳了如下额外复杂性和并行测试时间计算:
这为 Opus 4 和 Sonnet 4 分别产生了 79.4% 和 80.2% 的分数。
Cognizant 和 Anthropic 扩展了他们的伙伴关系,为企业客户引入 Claude。
Opus 5 是 Opus 层级的阶跃式改进,驱动长时间运行的 Agent,同时在编码和专业工作中提供改进。