新模型在性能与成本间实现更好平衡,为API集成和成本敏感的应用场景提供新选择。
Claude Haiku 4.5 是我们最新的小型模型,从今天起向所有用户开放。
曾经处于前沿的技术如今更便宜更快速。五个月前,Claude Sonnet 4 是最先进的模型。今天,Claude Haiku 4.5 提供相似的代码性能水准,但成本降低至三分之一,速度提升超过两倍。
Claude Haiku 4.5 甚至在某些任务上超越了 Claude Sonnet 4,比如使用计算机。这些进步使 Claude for Chrome 等应用比以往更快更实用。
依赖 AI 处理实时、低延迟任务(如聊天助手、客户服务代理或配对编程)的用户将欣赏 Haiku 4.5 兼具高智能与卓越速度的组合。Claude Code 用户会发现 Haiku 4.5 让编程体验——从多代理项目到快速原型开发——显著更加响应迅速。
两周前发布的 Claude Sonnet 4.5 仍然是我们的前沿模型,也是全球最佳编码模型。Claude Haiku 4.5 为用户提供了一个新选择,当他们希望获得接近前沿的性能同时大幅降低成本时可选用。它还开启了新的模型组合使用方式。例如,Sonnet 4.5 可以将复杂问题分解成多步计划,然后编排多个 Haiku 4.5 团队并行完成子任务。
Claude Haiku 4.5 今天已在各处上线。作为开发者,只需通过 Claude API 使用 claude-haiku-4-5。定价现为每百万输入和输出令牌 $1/$5。
我们对 Claude Haiku 4.5 进行了详细的安全和对齐评估系列。该模型表现出较低的关键行为率,且相比其前身 Claude Haiku 3.5 的对齐度大幅提高。在我们的自动对齐评估中,Claude Haiku 4.5 相比 Claude Sonnet 4.5 和 Claude Opus 4.1 都显示了统计意义上的不对齐行为总体率显著降低——按此指标,Claude Haiku 4.5 成为我们迄今最安全的模型。
我们的安全测试还表明,Claude Haiku 4.5 在化学、生物、放射性和核(CBRN)武器生产方面的风险仅为有限。基于这个原因,我们在人工智能安全级别 2(ASL-2)标准下发布了它——相比为 Sonnet 4.5 和 Opus 4.1 设置的更严格的 ASL-3。你可以在 Claude Haiku 4.5 系统卡中阅读该模型 ASL-2 分类的完整理由,以及我们所有其他安全测试的详情。
Claude Haiku 4.5 现已在 Claude Code 和我们的应用上可用。其效率意味着你在维持高端模型性能的同时,可以在使用额度内完成更多工作。
开发者可在我们的 API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 上使用 Claude Haiku 4.5,它在这些平台上作为 Haiku 3.5 和 Sonnet 4 的直接替代品,采用我们最经济的定价。
完整的技术细节和评估结果请参看我们的系统卡、模型页面和文档。
所有 Claude 结果采用简单脚手架报告,包含两个工具——bash 和通过字符串替换进行文件编辑。我们报告的 73.3% 是在 50 次试验中的平均值,无测试时计算,128K 思维预算,以及在完整 500 问题 SWE-bench Verified 数据集上的默认采样参数(温度、top_p)。
报告分数采用了一项较小的提示补充:"你应该尽可能多地使用工具,理想情况下超过 100 次。在尝试解决问题之前,你也应该先实现自己的测试。"
所有报告的分数使用默认代理框架(Terminus 2)和 XML 解析器,平均 11 次运行(6 次无思维,得分 40.21%;5 次使用 32K 思维预算,得分 41.75%),n-attempts=1。
分数通过使用扩展思维(128k 思维预算)和默认采样参数(温度、top_p)的工具使用,在 10 次运行中平均获得。针对 Airline 和 Telecom Agent Policy 提示词补充了指令,使 Claude 在使用原始提示时更好地针对其已知失败模式。同时在 Telecom User 提示词中添加了提示补充,以避免用户错误地结束交互导致的失败模式。
Haiku 4.5 分数报告为 10 次独立运行的平均值,每次计算 pass@1 超过 16 次试验,采用默认采样参数(温度、top_p)和 128K 思维预算。
所有分数采用官方 OSWorld-Verified 框架报告,最大 100 步,在 4 次运行中平均,配置 128K 总思维预算和 2K 每步思维预算。
所有分数是 14 种非英语语言上 10 次运行的平均值,使用 128K 思维预算。
所有其他分数在默认采样参数(温度、top_p)和 128K 思维预算的情况下,平均超过 10 次运行。
所有 OpenAI 分数报告来自其 GPT-5 发布文章、GPT-5 for developers 发布文章、GPT-5 系统卡(SWE-bench Verified 使用 n=500)和 Terminal Bench 排行榜(使用 Terminus 2)。所有 Gemini 分数报告来自其模型网页和 Terminal Bench 排行榜(使用 Terminus 1)。
Cognizant 和 Anthropic 扩展合作关系,为企业客户提供 Claude
Opus 5 是 Opus 层级的飞跃式改进,驱动长期运行代理同时在编码和专业工作中提供优化。