前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9492
  • GPT-6发布:内置可交互UI组件,Haiku 5.5降价75%
  • Claude Haiku 5.5 定价解析:超 10 万 token 后性价比骤降
  • Agent 置信度层:何时判定模型「不知道」
  • Claude Haiku 5.5 正式发布:百万上下文、百万 token 仅 $0.10
  • 让 AI Agent 变得无聊:确定性层设计
  • GitHub Copilot 已上线 Claude Haiku 5.5
  • DeepGEMM 开源:英伟达 GPU 高性能 GEMM 内核库
  • 如何防止AI Agent向诈骗者付款:地址风险检查实战
  • x402支付第四大陷阱:无支出策略导致的钱包耗尽
  • GPT-6 发布:ChatGPT 新增交互式 UI,可生成图表按钮
  • Claude Haiku 5.5 登陆 AWS,性价比提升 75%
  • Claude Haiku 5.5 基准跃升 72.4%,价格下调九成
  • n8n AI Agent 五大生产环境故障及修复方案
  • 验证Agent不要看输出,要看状态diff
  • Claude Code按决策类型而非难度分配模型
  • K3 vs DeepSeek V4:开源模型如何选型
  • OpenAI 发布 722 篇数学论文
  • Cloud Run 免费自定义子域名:告别复杂 Demo URL
  • OpenAI 失控 Agent 在维基媒体项目活动曝光
  • GitHub Copilot 修复用量统计中 Agent 活动丢失问题
  • OpenAI 发布数百个数学难题的解答成果
  • 29款LLM谄媚度基准测试:前沿模型稳住了,小模型全面溃败
  • llm-openai-decisions 插件发布:支持 GPT-6 Astra 决策 API
  • Anthropic开放Claude最强版本用于安全测试:已发现10万漏洞
  • 谷歌 EmbeddingGemma 2:7.4 亿参数多模态嵌入模型,手机端 191MB 即可运行
  • 无 API 桌面应用远程控制方案:用 CDP 桥接手机与 Claude Code
  • AI功能按调用计费:多数设计在浪费预算
  • Simon Willison 点评 EmbeddingGemma 2:开源权重是嵌入模型唯一理智选择
  • Mistral Large 4预览发布:参数破万亿
  • Google发布EmbeddingGemma 2:开源多模态嵌入模型
  • Google 开源 EmbeddingGemma 2:740M 参数端侧向量模型,191MB 内存跑离线 RAG
  • 间接提示注入攻击链解析与防御架构
  • Whisper 口述转文字 WER 从 8.5% 降至 2.5% 的实战总结
  • 用 AgentCore + OpenClaw 构建持久记忆的个人 AI 助手
  • Google开源EmbeddingGemma 2:7.4亿参数多模态向量模型
  • Mistral Large 4 发布,推理能力增强
  • Mistral Large 4:1.05万亿参数多模态MoE模型预览
  • Vercel AI Gateway 新增置信度触发降级策略
  • QA 工程师自建工具链:验证 AI 编程 Agent 的实际工作成果
  • 一个 MCP 服务器给 Claude Code 接入 200+ 图像视频生成模型
  • Agentic AI 需要元过滤器而非传统 Guardrails:安全架构新思路
  • 2026 开发者调查:AI 编程助手日活高但信任度低
  • 已加载 42 / 9492
8.0
热点
AI SCORE
工具产品2026-10-08 02:49

Claude Haiku 5.5 基准跃升 72.4%,价格下调九成

The Decoder#Anthropic#Claude Haiku#价格战
Editor brief · 编辑速览

OSWorld 基准测试从 15.7% 升至 72.4%,token 价格最高降 90%,但新分词器增加了单任务 token 消耗。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Anthropic 发布了 Claude Haiku 5.5,这是该公司迄今为止最快、最便宜的小模型,专为数据查询和客户支持等高容量任务而构建。

Haiku 5.5 在基准测试中相比 Haiku 4.5 有大幅提升,token 价格最高降低 90%,在 Agent 编程等领域也超越了 OpenAI 的平价模型 GPT-6 Luna。

Haiku 5.5 现已在 AWS、Google Cloud 和 Azure 上线。Anthropic 还将 Sonnet 5.5 的缓存读取成本减半,并为订阅用户推出每月 API 额度。


Anthropic 发布了 Claude Haiku 5.5,这是该公司迄今为止最快、最便宜的小模型。基准测试结果显示其性能相比前代有大幅提升,同时 Anthropic 也在下调 Sonnet 5.5 的价格。

根据 Anthropic 的介绍,Haiku 5.5 专为高容量、成本敏感的任务设计,如摘要生成、数据库查询、分类和实时客户支持。平均来看,该模型的费用比 Haiku 4.5 低约 75%。对于不超过 10 万 token 的请求(Anthropic 表示这约占此前所有 Haiku 请求的 90%),价格降幅高达 90%。超过 10 万 token 的请求费用是前者的五倍。

Anthropic 指出,Haiku 5.5 使用了更新后的分词器,每个任务消耗的 token 略多于前代。Opus 4.x 系列中也出现过同样的情况,分词器变化单独就导致 token 使用量增加约 30%。因此实际节省的成本可能低于按 token 单价计算的结果。

基准测试显示大幅超越 Haiku 4.5

Haiku 5.5 在知识基准测试 GDPval-AA v2.1 中得分为 1620,是前代 735 分的两倍多。在 Humanity's Last Exam 中,不使用工具得 45.9%,使用工具得 57.4%,而前代分别为 10.2% 和 18.7%。

最大幅的提升出现在计算机使用(computer use)方面,即模型自主操作计算机。由于计算机使用会消耗大量 token,像 Haiku 5.5 这样廉价快速的模型天然契合。在 OSWorld-2.1 上得 72.4%,前代仅为 15.7%。在 Agent 编程基准测试 Terminal-Bench 4.0 上,Haiku 5.5 达到 39.2%,而 Haiku 4.5 得分为零。

Anthropic 还列出了 OpenAI 平价模型 GPT-6 Luna 作为对比,Haiku 5.5 在所有测试类别中均领先。不过 Sonnet 5.5 的参考分数表明,Haiku 5.5 仍明显落后于 Anthropic 旗下更大的模型。

首个支持灵活推理级别的 Haiku 模型

Haiku 5.5 是首个支持可调推理级别(adjustable reasoning levels)的 Haiku 级模型,让用户可以在成本和质量之间权衡。Anthropic 表示,该模型最适合范围明确的任务,如压缩、摘要或子 Agent 工作。对于复杂的 Agent 编程,Sonnet 5.5 和 Opus 5.5 仍是更好的选择。

网络安全保障比前代更严格,但比 Sonnet 5.5 允许更广泛的防御性任务范围,部分原因是该模型整体能力较弱。渗透测试仍然被阻止。有更广泛需求的组织可以申请 Anthropic 的生命科学和网络安全验证计划。

Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。

Sonnet 5.5 也降价,Anthropic 发放 API 额度

配合 Haiku 发布,Anthropic 将 Sonnet 5.5 的缓存读取成本降低 50%,从每百万 token 0.20 美元降至 0.10 美元。该公司表示,这应能使大多数 Agent 任务成本降低约 20%。此举无疑是对 OpenAI 新 GPT-6.1 系列的回应,表明 AI 价格战打得比以往任何时候都更激烈。

Anthropic 还将推出每月 API 额度。Max-5x 订阅者获得 100 美元,Max-20x 订阅者获得 200 美元,Team 订阅者每月最多获得 500 美元。用户可以用这些额度通过 API 试用各种工具、应用和 Agent。

该公司还在更新 Python 和 TypeScript SDK,添加计算机使用和浏览器使用的 Beta 支持。


Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Haiku 5.5 登陆 AWS,性价比提升 75%
下一篇
n8n AI Agent 五大生产环境故障及修复方案