OSWorld 基准测试从 15.7% 升至 72.4%,token 价格最高降 90%,但新分词器增加了单任务 token 消耗。
Anthropic 发布了 Claude Haiku 5.5,这是该公司迄今为止最快、最便宜的小模型,专为数据查询和客户支持等高容量任务而构建。
Haiku 5.5 在基准测试中相比 Haiku 4.5 有大幅提升,token 价格最高降低 90%,在 Agent 编程等领域也超越了 OpenAI 的平价模型 GPT-6 Luna。
Haiku 5.5 现已在 AWS、Google Cloud 和 Azure 上线。Anthropic 还将 Sonnet 5.5 的缓存读取成本减半,并为订阅用户推出每月 API 额度。
Anthropic 发布了 Claude Haiku 5.5,这是该公司迄今为止最快、最便宜的小模型。基准测试结果显示其性能相比前代有大幅提升,同时 Anthropic 也在下调 Sonnet 5.5 的价格。
根据 Anthropic 的介绍,Haiku 5.5 专为高容量、成本敏感的任务设计,如摘要生成、数据库查询、分类和实时客户支持。平均来看,该模型的费用比 Haiku 4.5 低约 75%。对于不超过 10 万 token 的请求(Anthropic 表示这约占此前所有 Haiku 请求的 90%),价格降幅高达 90%。超过 10 万 token 的请求费用是前者的五倍。
Anthropic 指出,Haiku 5.5 使用了更新后的分词器,每个任务消耗的 token 略多于前代。Opus 4.x 系列中也出现过同样的情况,分词器变化单独就导致 token 使用量增加约 30%。因此实际节省的成本可能低于按 token 单价计算的结果。
Haiku 5.5 在知识基准测试 GDPval-AA v2.1 中得分为 1620,是前代 735 分的两倍多。在 Humanity's Last Exam 中,不使用工具得 45.9%,使用工具得 57.4%,而前代分别为 10.2% 和 18.7%。
最大幅的提升出现在计算机使用(computer use)方面,即模型自主操作计算机。由于计算机使用会消耗大量 token,像 Haiku 5.5 这样廉价快速的模型天然契合。在 OSWorld-2.1 上得 72.4%,前代仅为 15.7%。在 Agent 编程基准测试 Terminal-Bench 4.0 上,Haiku 5.5 达到 39.2%,而 Haiku 4.5 得分为零。
Anthropic 还列出了 OpenAI 平价模型 GPT-6 Luna 作为对比,Haiku 5.5 在所有测试类别中均领先。不过 Sonnet 5.5 的参考分数表明,Haiku 5.5 仍明显落后于 Anthropic 旗下更大的模型。
Haiku 5.5 是首个支持可调推理级别(adjustable reasoning levels)的 Haiku 级模型,让用户可以在成本和质量之间权衡。Anthropic 表示,该模型最适合范围明确的任务,如压缩、摘要或子 Agent 工作。对于复杂的 Agent 编程,Sonnet 5.5 和 Opus 5.5 仍是更好的选择。
网络安全保障比前代更严格,但比 Sonnet 5.5 允许更广泛的防御性任务范围,部分原因是该模型整体能力较弱。渗透测试仍然被阻止。有更广泛需求的组织可以申请 Anthropic 的生命科学和网络安全验证计划。
Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。
配合 Haiku 发布,Anthropic 将 Sonnet 5.5 的缓存读取成本降低 50%,从每百万 token 0.20 美元降至 0.10 美元。该公司表示,这应能使大多数 Agent 任务成本降低约 20%。此举无疑是对 OpenAI 新 GPT-6.1 系列的回应,表明 AI 价格战打得比以往任何时候都更激烈。
Anthropic 还将推出每月 API 额度。Max-5x 订阅者获得 100 美元,Max-20x 订阅者获得 200 美元,Team 订阅者每月最多获得 500 美元。用户可以用这些额度通过 API 试用各种工具、应用和 Agent。
该公司还在更新 Python 和 TypeScript SDK,添加计算机使用和浏览器使用的 Beta 支持。