Claude Opus 4.1 新版发布
Anthropic 发布主流 AI 编程助手的重要迭代版本。直接影响程序员的编程效率和可用工具能力。
Anthropic 发布主流 AI 编程助手的重要迭代版本。直接影响程序员的编程效率和可用工具能力。
今天我们发布 Claude Opus 4.1,这是对 Claude Opus 4 在 agentic 任务、实际编码和推理能力上的升级。我们计划在未来几周内发布更大幅度的模型改进。
Opus 4.1 现已向付费 Claude 用户和 Claude Code 开放。它也已在我们的 API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 上推出。价格与 Opus 4 相同。
Opus 4.1 将我们最先进的编码性能提升到 SWE-bench Verified 上的 74.5%。它还改进了 Claude 在深度研究和数据分析方面的能力,尤其是在细节跟踪和 agentic 搜索方面。
GitHub 指出,Claude Opus 4.1 在相对于 Opus 4 的大多数能力方面都有改进,在多文件代码重构方面尤其有显著的性能提升。Rakuten Group 发现 Opus 4.1 在大型代码库中精确定位修复而不做不必要的调整或引入 bug 方面表现出色,他们的团队更喜欢这种精确性用于日常调试任务。Windsurf 报告 Opus 4.1 在他们的初级开发者基准上相比 Opus 4 提高了一个标准差,显示出大约与从 Sonnet 3.7 到 Sonnet 4 的跳跃相同的性能提升。
我们建议在所有用途上从 Opus 4 升级到 Opus 4.1。如果你是开发者,只需通过 API 使用 claude-opus-4-1-20250805。你也可以查看我们的 system card、模型页面、定价页面和文档来了解更多。
如往常一样,你的反馈帮助我们改进,尤其是当我们继续发布新的更强大的模型时。
OpenAI: o3 launch post, o3 system card
Gemini: 2.5 Pro model card
Claude: Sonnet 3.7 launch post, Claude 4 launch post
Claude 模型是混合推理模型。本博客文章报告的基准测试展示了通过或不通过扩展思考达到的最高分数。我们在下面为每个结果注明了是否使用了扩展思考:
无扩展思考:SWE-bench Verified、Terminal-Bench
以下基准测试通过扩展思考(最多 64K 个 token)报告:TAU-bench、GPQA Diamond、MMMLU、MMMU、AIME
通过对 Airline 和 Retail Agent Policy 的提示词附录实现的分数,指导 Claude 在使用扩展思考和工具使用时更好地利用其推理能力。该模型被鼓励在解决问题时记下其想法,这与我们通常的思考模式不同,在多轮轨迹中最好地利用其推理能力。为了适应 Claude 通过利用更多思考而产生的额外步骤,最大步数(按模型完成计数)从 30 增加到 100(大多数轨迹在 30 步以下完成,只有一个轨迹超过 50 步)。
对于 Claude 4 系列模型,我们继续使用相同的简单框架,该框架只为模型配备我们在之前发布中描述的两个工具——一个 bash 工具和一个通过字符串替换操作的文件编辑工具。我们不再包括 Claude 3.7 Sonnet 使用的第三个"规划工具"。在所有 Claude 4 模型上,我们报告的分数来自完整的 500 个问题。OpenAI 模型的分数来自 477 个问题的子集。
Opus 5 是 Opus 层级的阶跃式改进,为长时间运行的 agent 提供支持,同时在编码和专业工作中也有改进。