Anthropic 发布 Claude Sonnet 4.5,在 Hacker News 获得 1585 分和 786 条讨论,重大模型升级将直接改变程序员的 AI 编程工作流。
Claude Sonnet 4.5 是世界上最好的编码模型。它是构建复杂 Agent 最强大的模型。它是使用计算机最好的模型。它在推理和数学方面展现了巨大的进步。
代码无处不在。它运行着你使用的每个应用、电子表格和软件工具。能够使用这些工具并推理解决难题是现代工作的完成方式。
Claude Sonnet 4.5 让这一切成为可能。我们正在发布它,同时发布一系列主要的产品升级。在 Claude Code 中,我们添加了检查点功能——这是我们收到最多要求的功能之一——可以保存你的进度,并允许你立即回滚到之前的状态。我们刷新了终端界面,并发布了原生 VS Code 扩展。我们为 Claude API 添加了新的上下文编辑功能和记忆工具,使 Agent 能够运行更长时间并处理更大的复杂性。在 Claude 应用中,我们将代码执行和文件创建(电子表格、幻灯片和文档)直接带入了对话。我们还向上月加入等待名单的 Max 用户提供了 Claude for Chrome 扩展。
我们也在为开发者提供我们用来构建 Claude Code 的基础设施。我们称之为 Claude Agent SDK。支撑我们前沿产品的基础设施——使它们能够充分发挥潜力——现在可供你使用。
这是我们发布的最对齐的前沿模型,在与之前的 Claude 模型相比的多个对齐领域表现出了显著改进。
Claude Sonnet 4.5 从今天开始在所有地方可用。如果你是开发者,只需通过 Claude API 使用 claude-sonnet-4-5。价格保持与 Claude Sonnet 4 相同,为每百万 token 3 美元/15 美元。
Claude Sonnet 4.5 在 SWE-bench Verified 评估上处于最先进水平,该评估衡量真实世界的软件编码能力。从实际来看,我们观察到它在复杂、多步任务上能够保持专注 30 多小时。
Claude Sonnet 4.5 在计算机使用方面代表了一次重大飞跃。在测试 AI 模型真实世界计算机任务的 OSWorld 基准上,Sonnet 4.5 现在以 61.4% 领先。仅在四个月前,Sonnet 4 以 42.2% 领先。我们的 Claude for Chrome 扩展将这些升级后的功能付诸实用。在下面的演示中,我们展示了 Claude 直接在浏览器中工作,导航网站、填充电子表格并完成任务。
该模型在包括推理和数学在内的广泛评估中也表现出了改进的能力:
金融、法律、医学和 STEM 领域的专家发现 Sonnet 4.5 相比旧模型(包括 Opus 4.1)展现出明显更好的领域特定知识和推理能力。
该模型的能力也反映在早期客户的体验中:
除了是我们最强大的模型,Claude Sonnet 4.5 是我们最对齐的前沿模型。Claude 改进的能力和我们广泛的安全培训使我们能够大幅改进模型的行为,减少令人担忧的行为,如阿谀奉承、欺骗、权力寻求以及鼓励妄想思维的倾向。对于模型的 Agent 和计算机使用能力,我们在防御 prompt injection 攻击方面也取得了相当大的进展,这是这些能力的用户面临的最严重风险之一。
你可以在 Claude Sonnet 4.5 系统卡中阅读详细的安全和对齐评估,该卡首次包括使用机制可解释性技术的测试。
Claude Sonnet 4.5 在我们的 AI 安全等级 3(ASL-3)保护下发布,符合我们将模型能力与适当保障措施相匹配的框架。这些保障措施包括被称为分类器的过滤器,旨在检测潜在危险的输入和输出——特别是那些与化学、生物、放射性和核(CBRN)武器相关的。
这些分类器有时可能无意中标记正常内容。我们已经使用户能够轻松继续与 Sonnet 4 进行任何中断的对话,这是一个风险较低的 CBRN 模型。我们已经在减少这些误报方面取得了显著进展,自我们最初描述它们以来减少了十倍,自今年 5 月 Claude Opus 4 发布以来减少了两倍。我们正在继续努力使分类器更具辨别力¹。
我们花了超过六个月的时间为 Claude Code 发布更新,所以我们知道构建和设计 AI Agent 需要什么。我们解决了难题:Agent 如何应该在长期运行任务中管理记忆,如何处理在自主性和用户控制之间平衡的权限系统,以及如何协调多个 Agent 朝着共同目标工作。
现在我们为你提供所有这一切。Claude Agent SDK 是支撑 Claude Code 的相同基础设施,但它对极其广泛的任务类别(而不仅仅是编码)展现了令人印象深刻的好处。从今天开始,你可以使用它来构建你自己的 Agent。
我们构建 Claude Code 是因为我们想要的工具还不存在。Agent SDK 为你提供了相同的基础,以构建同样强大的东西来解决你面临的任何问题。
我们在发布 Claude Sonnet 4.5 的同时发布一个临时研究预览,称为"Imagine with Claude"。
在这个实验中,Claude 即时生成软件。没有预先确定的功能;没有预先编写的代码。你看到的是 Claude 实时创建,在你交互时响应并适应你的请求。
这是一个有趣的演示,展示了 Claude Sonnet 4.5 能做什么——当你将强大的模型与正确的基础设施结合时,可以看到什么是可能的。
"Imagine with Claude"对 Max 订阅者在接下来的五天内可用。我们鼓励你在 claude.ai/imagine 上尝试它。
我们建议为所有用途升级到 Claude Sonnet 4.5。无论你是通过我们的应用、API 还是 Claude Code 使用 Claude,Sonnet 4.5 都是一个直接替代品,以相同的价格提供性能提升。Claude Code 更新对所有用户可用。Claude 开发者平台更新(包括 Claude Agent SDK)对所有开发者可用。代码执行和文件创建在 Claude 应用的所有付费计划中可用。
有关完整的技术细节和评估结果,请参阅我们的系统卡、模型页面和文档。有关更多信息,探索我们关于网络安全的工程帖子和研究帖子。
¹:网络安全和生物研究行业的客户可以与他们的账户团队合作,同时加入我们的允许列表。
SWE-bench Verified:所有 Claude 结果都使用简单的框架报告,该框架带有两个工具——bash 和通过字符串替换的文件编辑。我们报告 77.2%,这是在 10 次试验上的平均值,没有测试时间计算,在完整 500 问题 SWE-bench Verified 数据集上的 200K 思考预算。报告的分数使用了一个小的 prompt 补充:"你应该尽可能多地使用工具,理想情况下超过 100 次。你还应该在尝试问题之前首先实现自己的测试。"1M 上下文配置达到了 78.2%,但我们报告 200K 结果作为我们的主要分数,因为 1M 配置与我们最近的推理问题有关。对于我们的"高计算"数字,我们采用额外的复杂性和并行测试时间计算如下:
这导致 Sonnet 4.5 的分数为 82.0%。
报告的分数使用了一个小的 prompt 补充:"你应该尽可能多地使用工具,理想情况下超过 100 次。你还应该在尝试问题之前首先实现自己的测试。"
1M 上下文配置达到了 78.2%,但我们报告 200K 结果作为我们的主要分数,因为 1M 配置与我们最近的推理问题有关。
Terminal-Bench:所有报告的分数使用默认 Agent 框架(Terminus 2),带有 XML 解析器,在不同日期的多次运行中平均以平滑 eval 对推理基础设施的敏感性。
τ2-bench:使用扩展思考和工具使用以及对航空公司和电信 Agent 政策 Airline 和 Telecom Agent Policy 的 prompt 补充来实现分数,指导 Claude 在使用原生 prompt 时更好地针对其已知的失败模式。还为电信用户 prompt 添加了 prompt 补充,以避免用户错误地结束交互的失败模式。
AIME:Sonnet 4.5 分数使用温度 1.0 的采样报告。该模型对 Python 配置使用了 64K 推理 token。
OSWorld:所有报告的分数使用官方 OSWorld-Verified 框架,最大 100 步,在 4 次运行中平均。
MMMLU:所有报告的分数都是 5 次运行在 14 种非英语语言上的平均值,使用扩展思考(最多 128K)。
Finance Agent:所有报告的分数都由 Vals AI 在其公开排行榜上运行和发布。所有报告的 Claude 模型结果都使用扩展思考(最多 64K),Sonnet 4.5 报告打开了交错思考。
所有 OpenAI 分数都从他们的 GPT-5 帖子、GPT-5 开发者帖子、GPT-5 系统卡(SWE-bench Verified 使用 n=500 报告)、Terminal Bench 排行榜(使用 Terminus 2)和公开 Vals AI 排行榜报告。所有 Gemini 分数都从他们的模型网页、Terminal Bench 排行榜(使用 Terminus 1)和公开 Vals AI 排行榜报告。
Cognizant 和 Anthropic 拓展合作关系,为企业客户提供 Claude
推出 Claude Opus 5
Opus 5 是 Opus 等级的一次飞跃性改进,为长期运行 Agent 提供支持,同时在编码和专业工作中提供改进。