Claude 3.7 Sonnet 与 Claude Code 发布
Anthropic 发布重大模型和编码工具升级(2127 点讨论),直接改变 AI 编程工作方式。
Anthropic 发布重大模型和编码工具升级(2127 点讨论),直接改变 AI 编程工作方式。
今天,我们宣布推出 Claude 3.7 Sonnet,这是我们迄今为止最聪慧的模型,也是市场上首个混合推理模型。Claude 3.7 Sonnet 既可以立即生成响应,也可以生成对用户可见的扩展且分步骤的思考过程。API 用户也可以精细控制模型思考的时间长度。
Claude 3.7 Sonnet 在编码和前端网页开发领域展现了尤其强劲的改进。与该模型一同,我们还推出了一个用于智能体编码的命令行工具 Claude Code。Claude Code 以有限研究预览版的形式推出,使开发者能够直接从终端将大量工程任务委派给 Claude。
Claude 3.7 Sonnet 现已可用于所有 Claude 计划——包括 Free、Pro、Team 和 Enterprise——以及 Claude Developer Platform、Amazon Bedrock 和 Google Cloud 的 Vertex AI。扩展思考模式在除免费 Claude 层级外的所有平台上可用。
在标准模式和扩展思考模式中,Claude 3.7 Sonnet 的价格与其前代产品相同:每百万输入 token 3 美元,每百万输出 token 15 美元——包括思考 token。
我们以一种不同于市场上其他推理模型的哲学来开发 Claude 3.7 Sonnet。就像人类用同一大脑既能快速回应又能深度思考一样,我们相信推理应该是前沿模型的集成能力,而不是完全独立的模型。这种统一的方式也为用户创造了更加无缝的体验。
Claude 3.7 Sonnet 在多个方面体现了这一哲学。首先,Claude 3.7 Sonnet 既是普通的 LLM 又是推理模型:你可以选择何时希望模型直接回答,何时希望它在回答前花更多时间思考。在标准模式下,Claude 3.7 Sonnet 代表 Claude 3.5 Sonnet 的升级版本。在扩展思考模式下,它在回答前会自我反思,这改进了它在数学、物理、指令遵循、编码和许多其他任务上的性能。我们通常发现模型的 prompt 在两种模式中的工作方式类似。
其次,当通过 API 使用 Claude 3.7 Sonnet 时,用户也可以控制思考的预算:你可以告诉 Claude 思考时间不超过 N 个 token,N 的范围可以是任何值,最高到其 128K token 的输出限制。这使你能够权衡速度(和成本)与答案的质量。
第三,在开发推理模型的过程中,我们对数学和计算机科学竞赛问题的优化程度有所降低,转而将重点转向更好地反映企业如何实际使用 LLM 的真实任务。
早期测试表明 Claude 在所有编码能力方面的领先地位:Cursor 指出 Claude 再次成为真实编码任务的一流水平,在从处理复杂代码库到高级工具使用等众多领域都有显著改进。Cognition 发现它在规划代码更改和处理全栈更新方面远优于任何其他模型。Vercel 强调了 Claude 在复杂 agent 工作流中的卓越精确性,而 Replit 已成功部署 Claude 从零开始构建精细的网页应用和仪表板,而其他模型则会停顿。在 Canva 的评估中,Claude 始终生成生产就绪的代码,设计品味优越,错误大幅降低。
自 2024 年 6 月以来,Sonnet 一直是全球开发者的首选模型。今天,我们通过以有限研究预览版形式推出我们的第一个智能体编码工具 Claude Code,进一步为开发者赋能。
Claude Code 是一个活跃的协作者,它可以搜索和读取代码、编辑文件、编写和运行测试、提交和推送代码到 GitHub,并使用命令行工具——让你在每一步都保持了解。
Claude Code 是一个早期产品,但已经成为我们团队不可或缺的工具,特别是在测试驱动开发、调试复杂问题和大规模重构方面。在早期测试中,Claude Code 在一次通过中完成了通常需要 45 分钟以上手动工作的任务,减少了开发时间和开销。
在接下来的几周内,我们计划根据我们的使用情况不断改进它:增强工具调用的可靠性、添加对长期运行命令的支持、改进应用内渲染和拓展 Claude 对其自身能力的理解。
我们对 Claude Code 的目标是更好地理解开发者如何使用 Claude 进行编码,以便为未来的模型改进提供信息。通过加入这个预览版,你将获得我们用来构建和改进 Claude 的相同强大工具,你的反馈将直接塑造它的未来。
我们也改进了 Claude.ai 上的编码体验。我们的 GitHub 集成现已可用于所有 Claude 计划——使开发者能够直接将他们的代码库连接到 Claude。
Claude 3.7 Sonnet 是我们迄今为止最好的编码模型。通过更深入地理解你的个人、工作和开源项目,它成为在你最重要的 GitHub 项目上修复错误、开发功能和构建文档的更强大伙伴。
我们对 Claude 3.7 Sonnet 进行了广泛的测试和评估,与外部专家合作以确保它符合我们对安全性、稳健性和可靠性的标准。与其前代产品相比,Claude 3.7 Sonnet 在区分有害和良性请求方面做出了更细致的区分,不必要的拒绝减少了 45%。
本版本的系统卡涵盖了多个类别的新安全结果,提供了我们负责任扩展政策评估的详细分解,其他 AI 实验室和研究人员可以将其应用到他们的工作中。该卡还涉及计算机使用带来的新兴风险,特别是 prompt 注入攻击,并解释了我们如何评估这些漏洞以及如何训练 Claude 来抵抗和减缓它们。此外,它还审视了推理模型的潜在安全益处:理解模型如何做出决策的能力,以及模型推理是否真正可信和可靠。阅读完整的系统卡以了解更多信息。
Claude 3.7 Sonnet 和 Claude Code 标志着朝向能够真正增强人类能力的 AI 系统迈出的重要一步。凭借其深度思考、自主工作和有效协作的能力,它们将我们带向一个 AI 丰富和扩展人类能力的未来。
我们很高兴让你探索这些新能力,也期待看到你将用它们创造什么。一如既往,我们欢迎你的反馈,因为我们继续改进和发展我们的模型。
1 命名的经验教训。
分数是通过添加一个 prompt 补充来实现的,该补充指导航空公司 Agent 政策中的 Claude 更好地使用"规划"工具,模型被鼓励在解决问题时写下其思想,这与我们通常的思考模式不同,在多轮轨迹中最好地利用其推理能力。为了适应 Claude 通过利用更多思考而产生的额外步骤,最大步数(由模型完成次数计数)从 30 增加到 100(大多数轨迹在 30 步内完成,只有一个轨迹超过 50 步)。
此外,Claude 3.5 Sonnet(新版本)的 TAU-bench 分数与我们在发布时最初报告的不同,因为自那以后引入了小的数据集改进。我们在更新的数据集上重新运行,以便与 Claude 3.7 Sonnet 进行更准确的比较。
解决 SWE-bench 这样的开放式智能体任务有许多方法。一些方法将决定要调查或编辑哪些文件以及要运行哪些测试的复杂性大部分转移给更传统的软件,让核心语言模型在预定义的地方生成代码或从更有限的动作集中选择。Agentless(Xia et al., 2024)是一个流行的框架,用于评估 Deepseek 的 R1 和其他模型,它用 prompt 和嵌入式文件检索机制、补丁本地化和针对回归测试的最佳 40 拒绝采样来增强 agent。其他脚手架(例如 Aide)进一步用额外的测试时间计算(以重试、最佳 N 或蒙特卡洛树搜索 (MCTS) 的形式)来补充模型。
对于 Claude 3.7 Sonnet 和 Claude 3.5 Sonnet(新版本),我们使用了一个更简单的方法,脚手架最少,模型在单个会话中决定运行哪些命令和编辑哪些文件。我们的主要"无扩展思考"pass@1 结果只需装备该模型具有这里描述的两个工具——一个 bash 工具和一个通过字符串替换操作的文件编辑工具——以及上面我们 TAU-bench 结果中提到的"规划工具"。由于基础设施限制,我们内部基础设施中实际上只有 489/500 个问题是可解决的(即,黄金解决方案通过了测试)。对于我们的原版 pass@1 分数,我们计算 11 个不可解决的问题为失败,以保持与官方排行榜的奇偶性。为了透明起见,我们单独发布了在我们的基础设施上不起作用的测试用例。
对于我们的"高计算"数字,我们采用了如下的额外复杂性和并行测试时间计算:
我们用上面的脚手架采样多个并行尝试
我们丢弃在仓库中的可见回归测试中破坏的补丁,类似于 Agentless 采用的拒绝采样方法;注意没有使用隐藏的测试信息。
然后我们用一个类似于我们在 GPQA 和 AIME 上的结果的评分模型对剩余的尝试进行排名,并为提交选择最好的。
这在我们基础设施上工作的 n=489 个经过验证的任务的子集上产生了 70.3% 的分数。没有这个脚手架,Claude 3.7 Sonnet 在使用这个相同的子集时在 SWE-bench Verified 上达到 63.7%。与我们内部基础设施不兼容的排除的 11 个测试用例是:
scikit-learn__scikit-learn-14710
sphinx-doc__sphinx-10435
sphinx-doc__sphinx-7985
sphinx-doc__sphinx-8475
matplotlib__matplotlib-20488
astropy__astropy-8707
astropy__astropy-8872
sphinx-doc__sphinx-8595
sphinx-doc__sphinx-9711
Cognizant 和 Anthropic 扩展合作伙伴关系,为企业客户引入 Claude
推出 Claude Opus 5
Opus 5 是 Opus 层级的阶梯式改进,为长期运行的 agent 提供支持,同时在编码和专业工作方面实现改进。