Anthropic 正式发布 Haiku 5.5,HN 社区热度极高,大量开发者讨论其在编程辅助和本地部署场景的表现。
正式发布 Claude Haiku 5.5:这是我们有史以来最便宜、最快、最强大的一款小模型。
Claude Haiku 5.5 专为高吞吐量、对成本敏感的任务设计。它能可靠地处理快速且重复性的工作负载(如摘要、压缩、数据库查询、分类请求)。在与 Opus 5.5 和 Sonnet 5.5 搭配作为编程工作的 subagent 时表现出色。而且,由于它也是我们迄今为止最快的模型,特别适合对速度敏感的任务,如实时客户支持和浏览器操作。¹
Haiku 5.5 的价格比 Haiku 4.5 低很多,平均运行成本降低了约 75%。²
此次发布的同时,我们也在提升模型系列的整体价值。我们将 Claude Sonnet 5.5 缓存读取的价格减半,这意味着 Sonnet 5.5 在大多数 agentic 任务上的运行成本降低了约 20%。此外,我们还为 Claude Max 和 Team 订阅用户推出一项新的月度 API 额度,旨在支持用户基于 Claude Platform 构建新的 Agent 和应用。
以下是 Claude Haiku 5.5 在各项基准测试中的表现:
| Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 | |
|---|---|---|---|---|
| 知识工作 GDPval-AA v2.1 | 162 | 73 | 51 | 437 |
| 知识工作 AA-Briefcase v1.1 | 157 | 86 | 133 | 182 |
| 计算机使用 OSWorld 2.1(离线子集) | 72.4% | 15.7% | 48.9% | 83.9% |
| 多学科推理 Humanity's Last Exam(无工具) | 45.9% | 10.2% | — | 56.9% |
| 多学科推理 Humanity's Last Exam(带工具) | 57.4% | 18.7% | — | 64.5% |
| Agentic 编程 Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| Agentic 编程 FrontierCode 1.1(Main) | 46.4% | — | 42.4% | 52.1% |
| 高级视觉推理 Chartography | 46.4% | 6.4% | 29.1% | 61.6% |
关于我们如何运行评估的详细信息,请参阅 Haiku 5.5 System Card。
Haiku 5.5 是我们首款配备可调节 effort 设置的 Haiku 级别模型。这意味着,与我们其他模型一样,用户可以决定是优化成本还是优化智能。以下图表展示了 Haiku 5.5 在每种 effort 设置下于三项基准测试中的表现:

OSWorld 2.1 衡量的是 Agent 操作真实计算机以完成长序列、多步骤任务的能力。

Artificial Analysis 的 GDPval-AA v2.1 评估 Agent 在 44 个职业的真实专业工作中的表现。

Humanity's Last Exam(HLE)是一项测试专家级学术知识和推理能力的考试。
在早期测试中,我们的客户报告了与上述性能和成本改善一致的结果。以下是他们对新模型的评价:
"我们对 Claude Haiku 5.5 印象深刻,尤其是它的速度。我们用它跑了我们 AI Teammates(我们的 AI Agent 产品)的评估套件,覆盖了 bug 分诊、项目搭建、在大组合中搜索高风险或延期工作等用例。与我们目前使用的模型相比,任务完成延迟降低了 30% 以上,每次 Agent 轮次的推理速度提升了最多 2.5 倍。体验明显更敏捷了。"
"在 HubSpot,我们用模拟 portal 来评估新模型在 CRM 任务(如商机报告)上的表现。我们主要测试更小、更高效的模型,而 Claude Haiku 5.5 在这个套件上取得了我们迄今见过的最高分,三次运行平均 92.8%。一个 CRM 审计任务要求模型识别那些过时但模糊的记录。在我们测试的所有模型中,Haiku 5.5 完成该任务最快,且命中率最高、误报率最低。"
"Ask in Document 是我们最大的支出来源之一,每周在生产环境中处理约 800 万次调用。它在少数几份文档之上回答非常具体的问题。我们跑了 400 条查询,Claude Haiku 5.5 相比 Haiku 4.5 有统计上显著的改善:0.84 vs 0.76。"
"我们的客户在大规模企业内容上使用 Box AI。大规模使用带来了效率管理和成本控制的需求,同时也需要找到最适合手头任务的模型。在早期测试中,Claude Haiku 5.5 比 Haiku 4.5 高出 11 分,而延迟只有一半。我们会把它用在规模化运行的分析工作上,从成本报告到财务摘要和每周例行回顾。"
"Claude Haiku 5.5 适合我们的,是那种短小而高吞吐量的工作,比如快速查询、subagent 和摘要。当大模型在搭建演示文稿时,一个 Haiku 5.5 subagent 钻进去找到演示文稿所需的分段收入数据。它足够准确,值得我们信任,同时又快又便宜,我们可以大量运行它。"
"Claude Haiku 5.5 作为 sidekick 系列的一员加入了 Devin Fusion,表现非常出色。有了 Haiku 5.5 作为 sidekick,Fusion 在保持 FrontierCode 得分 66.2 的顶级水平的同时,还降低了成本和延迟。你今天就可以在 Devin CLI 中体验它,用 Opus 5.5 作为主模型。"
下表展示了 Claude Haiku 5.5 与我们其他模型的定价对比。Haiku 5.5 在处理不超过 100,000 token 的提示词时尤其划算,而这部分请求占了我们之前 Haiku 模型约 90% 的调用量。
对齐性。 Claude Haiku 5.5 在几乎所有对齐评估中都相较 Haiku 4.5 有重大改进。特别是,我们发现的对齐偏差行为实例大大减少,配合恶意使用的意愿也更低。模型的 System Card 详细描述了我们的评估过程和结果。
安全防护。 与其能力水平相一致,Haiku 5.5 的网络安全防护比 Haiku 4.5 更严格,但比我们近期其他模型应用的防护略为宽松。在网络安全方面,它们允许比 Sonnet 5.5 更广泛的防御性任务范围,但仍然会阻止渗透测试和其他更可能被攻击者使用的技术。
Haiku 5.5 的生物安全防护与 Sonnet 5、Sonnet 5.5 和 Opus 5 相同。它们允许研究类生物学问题,但限制我们判断为可能造成伤害的请求。从事更广泛生物学和网络活动的组织可以申请我们的 Life Sciences Verification Program 和 Cyber Verification Program。
Claude Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude Platform 上,开发者可以通过 claude-haiku-5-5 开始使用。
详见我们的迁移指南。
除了 Claude Haiku 5.5 的新定价之外,我们还在进一步提升模型和产品的价值。
首先,从今天开始,我们将降低 Claude Sonnet 5.5 缓存读取的价格。缓存读取现在便宜了 50%:每百万 token 从 0.20 美元降至 0.10 美元。由于缓存读取在模型 token 消耗中占很大比例,这使 Sonnet 5.5 在大多数 agentic 任务上的成本降低了约 20%。
例如,以下是降价对 Sonnet 5.5 在 Terminal-Bench 4.0 上性价比表现的影响:

Terminal-Bench 4.0 衡量模型在命令行界面中完成复杂多步骤专业任务的能力。
这张图阐明了 Haiku 5.5 与我们更大模型之间的一个重要区别。Sonnet 5.5 和 Opus 5.5 仍然是复杂 agentic 编程任务(如 Terminal-Bench 4.0 所测量)的更好选择。相比之下,Haiku 5.5 最适合范围更窄的任务——这类任务在以往版本的 Claude 中可能因成本过高而无法实现——比如压缩、摘要或 subagent 工作。
其次,本周我们将向所有 Max 和 Team 订阅用户推出一项新的月度 API 额度,用于 Claude Platform。Max 5x 用户每月获得 100 美元额度,Max 20x 用户获得 200 美元,Team 订阅用户将在用户间共享最多 500 美元。这些额度旨在让我们的用户能够试验构建调用我们 API 的工具、应用和 Agent。它们可以用于我们任何模型。更多信息请参阅我们的帮助中心文章。
对于开发者,我们也在更新 Claude Python 和 TypeScript SDK,新增对计算机使用和浏览器使用的 beta 支持。鉴于 Haiku 5.5 的速度、能力和价格组合,它尤其适合这些任务。你可以在 Claude Platform 文档中了解更多。
¹ Claude Haiku 5.5 在各模型标准速度下是我们迄今为止最快的模型,但在 Fast Mode 下运行速度不如 Opus 模型。
² Claude Haiku 5.5 在不超过 100,000 token 的请求上定价比 Claude Haiku 4.5 低 90%,在超过 100,000 token 的请求上低 50%。在 Haiku 4.5 上,90% 的请求属于前者。此计算还考虑了 Haiku 4.5 与 Haiku 5.5 之间完成给定工作所消耗 token 数量的变化:Haiku 5.5 采用了更新后的 tokenizer(类似于 Sonnet 5.5 和 Opus 5.5 的),这意味着每个任务使用的 token 略多。