Anthropic 发布 Haiku 5.5,100K token 内价格 $0.10/百万输入 token,OSWorld 基准 72.4%,已集成 GitHub Copilot。
Anthropic 发布了 Claude Haiku 5.5,这是其迄今为止最便宜、最快速的小模型。它面向高容量任务,如摘要、压缩、分类和子 Agent 任务。它保持了 100 万 token 的上下文窗口,最多可输出 12.8 万 token。定价为每百万输入 token 0.10 美元,每百万输出 token 0.50 美元。对于 10 万 token 以内的提示词,价格比 Claude Haiku 4.5 低 90%。
可以,作为托管 API 使用。Haiku 5.5 已在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 AWS 上的 Claude Platform 全面可用。
Haiku 5.5 是首个具有可调节 effort 设定的 Haiku 级模型。自适应思维(Adaptive thinking)默认开启,effort 参数默认为 medium。
它接受文本和图像输入,输出文本,知识截止日期为 2026 年 6 月。批处理作业在 beta 阶段最多支持 30 万输出 token。
有两个关键点需要注意:使用非默认的 temperature、top_p 或 top_k 值会返回 400 错误。新的 tokenizer 对相同文本计算的 token 数量比 Haiku 4.5 约多 30%。迁移指南涵盖了这两个问题。
定价以 10 万提示词 token 为分界点。10 万以内,输入成本为每百万 0.10 美元,输出为每百万 0.50 美元。缓存读取为 0.01 美元,5 分钟缓存写入为 0.125 美元。超过 10 万后,费率升至输入每百万 0.50 美元、输出每百万 2.50 美元。
Haiku 4.5 的定价为输入每百万 1 美元、输出每百万 5 美元。Anthropic 表示,约 90% 的 Haiku 4.5 请求保持在 10 万 token 以内。考虑到 tokenizer 的差异后,他们估计 Haiku 5.5 平均运行成本降低约 75%。批处理再额外享 5 折。
GPT-6 Luna 的短上下文费率与 Haiku 5.5 完全相同。其更高档位仅在超过 27.2 万输入 token 时才启用,定价为 0.20 美元和 0.75 美元。对于 15 万 token 的提示词,Luna 按定价表更便宜。
以下所有数据均来自 Anthropic 报告(见 system card):
Sonnet 5.5 仍在每一项上领先,包括 Terminal-Bench 4.0 的 70.6%。Anthropic 本身推荐在复杂的 Agent 编码任务中使用 Sonnet 5.5 和 Opus 5.5。
三类工作负载最适合 Haiku 5.5:
第一类是在 Opus 5.5 或 Sonnet 5.5 下运行的子 Agent 工作。 在 Rogo,一个 Haiku 5.5 子 Agent 可以拉取一条 10-K 收入线,而更大的模型则负责构建演示文稿。
第二类是高容量文档问答和摘要。 AlphaSense 在一个每周处理约 800 万次调用的功能上测试了它。
第三类是对速度敏感的工作, 如实时客户支持和浏览器使用。
| 功能 | Claude Haiku 5.5 | GPT-6 Luna | Gemini 3.5 Flash-Lite |
|---|---|---|---|
| 输入/输出(每百万) | $0.10 / $0.50 | $0.10 / $0.50 | $0.30 / $2.50 |
| 长提示词定价 | 100K 以上 $0.50 / $2.50 | 272K 以上 $0.20 / $0.75 | 固定费率 |
| 缓存读取(每百万) | $0.01 | $0.01 | $0.03 + 存储费 |
| 上下文窗口 | 100 万 token | 105 万 token | 104.8576 万 token |
| 最大输出 | 12.8 万 token | 12.8 万 token | 6.5536 万 token |
| 输入类型 | 文本、图像 | 文本、图像 | 文本、图像、视频、音频、PDF |
| 推理控制 | 自适应思维 + effort(默认 medium) | reasoning.effort none to max(默认 medium) | 支持 Thinking |
| 计算机使用 | SDK 支持(beta) | 支持(Responses API) | 支持(Preview) |
| 批处理折扣 | 50% | 50%(Batch and Flex) | 50% |
| 知识截止日期 | 2026 年 6 月 | 2026 年 5 月 18 日 | 模型页面未列出 |
| 运行平台 | Claude API、Bedrock、Google Cloud、Microsoft Foundry、AWS 上的 Claude Platform | OpenAI API | Gemini API |
数据来源:Anthropic 文档、Anthropic 公告、OpenAI 模型页面、OpenAI 定价、Google 模型页面、Google 定价。标准档列表价格,验证于 2026 年 10 月 7 日。
对于 10 万 token 以内的提示词,每百万输入 token 0.10 美元,每百万输出 token 0.50 美元。
100 万上下文、12.8 万输出、自适应思维并带有 effort 设定(默认为 medium)。
OSWorld 2.1 上达到 72.4%,而 Haiku 4.5 为 15.7%(Anthropic 报告数据)。
短上下文列表价格与 GPT-6 Luna 相同;Luna 在 10 万 token 以上更便宜。
定位为 Opus 5.5 和 Sonnet 5.5 下的子 Agent,而非编码主导角色。
查看技术详情。所有功劳归该项目的研究人员。同时,欢迎在 Twitter 上关注我们,不要忘记加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。还有!你在 telegram 上吗?现在你也可以加入我们了。
[Sponsored] Web 是大多数 Agent 缺失的那个 API。数据库、日历和代码仓库都有 API。开放的 Web 基本上没有。TinyFish MCP 服务器为任何 MCP 客户端提供四个工具:TinySearch、TinyFetch(将完整页面转为 markdown,包含 JavaScript)、TinyBrowser(用于登录和表单)和 TinyAgent(用于多步骤作业)。Search 和 Fetch 免费使用。
Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。凭借统计分析、机器学习和数据工程的坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。