前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8742
  • GPT-6 Sol发布:对齐能力逼近Astra,价格仅五分之一
  • GPT-6 Sol/Luna编程能力比肩Claude,成本降80%
  • Claude Opus 5.5发布:性能对标Fable 5.1,成本低40%
  • Claude Opus 5.5:编程修复成功率达97.5%,成本降40%
  • 开源工具llm 0.36支持GPT-6 Sol/Luna
  • JetBrains押注Agent开发:称其为26年最重要一步
  • 为 AI 代理添加预算守卫的实战方案
  • OpenAI GPT-6 Sol和Luna模型上线Amazon Bedrock
  • OpenAI发布GPT-6 Sol和Luna,API价格减半
  • OpenAI 发布 GPT-6 Sol/Luna 模型,Token 价格减半
  • GPT-6 Sol/Luna 正式发布:成本更低、错误更少
  • OpenAI 发布 GPT-6 Sol/Luna,主打低成本低幻觉
  • Claude Opus 5.5 登陆 Google Cloud,在 Model Garden 可用
  • Claude Opus 5.5 现已在 AWS Bedrock 可用
  • Strands Evals + Bedrock AgentCore:Agent 技能选择评估指南
  • llm-anthropic 0.29支持Claude Opus 5.5
  • Claude Opus 5.5发布:性能持平Fable 5.1,定价直降40%
  • GitHub Copilot上线Claude Opus 5.5,支持长时Agent任务
  • GitHub Copilot 新增 GPT-6 Sol/Luna 模型选项
  • Claude Opus 5.5 智能/性能/价格深度分析
  • Anthropic发布Opus 5.5降价20%,但Agent调用可能暗中路由至旧模型
  • Anthropic称Opus 5.5为「史上最强」,定价更低的Fable级性能
  • Anthropic 发布 Claude Opus 5.5:强化网络安全防护,遏制越狱行为
  • Claude Opus 5.5 正式发布:832 分成社区热议
  • 生产级 AI 语音 Agent 架构:WebSocket 与延迟优化实战
  • Permission Envelope:让 AI 权限自动过期的安全控制机制
  • llm-typesafe插件支持Jev模型二元判断
  • Python AI Agent 上线前必读:测试、可观测性与零成本方案
  • Cloudflare Worker Previews:为 Agent 每次变更提供隔离预览环境
  • NVIDIA Isaac ROS 5.0 发布:加速 Agentic 机器人开源开发
  • Meta Muse macOS 应用零日漏洞遭修复
  • 小米6天烧2000万训练开源模型MiMo,跃居开放模型榜首
  • LLM应用输入输出Guardrails实战指南
  • Claude发现libheif堆缓冲区溢出:HEIC图片供应链安全研究
  • 多模型调度与反馈闭环:基元律动CTO谈Agent持续进化
  • 阮一峰科技周刊第413期:再见了React Native
  • 用Python/ChromaDB/Gemini搭建轻量级RAG实战
  • 生产环境中降低LLM成本的七种实战方法
  • AI驱动开发反思:过度规格化反而拖累AI编程
  • AMD ROCm:AI Agent正在降低GPU编程门槛
  • 小米MiMo-V2.6-Pro登顶开源权重模型榜首,300万美元预训练
  • 四Agent并行:状态文件是保持一致性的关键
  • 长任务前何时压缩上下文:Claude Code实战经验
  • 5美元/月自建Qwen2.5 72B推理服务:vLLM+AWQ量化部署指南
  • Prompt缓存失效的根因:工作流在悄悄破坏精确前缀匹配
  • NVIDIA SoL-Pi:编码Agent的Token流量降低49%的Auto-Research框架
  • Grok 4.7 发布:更大基座、同价位,编程与 Agent 任务升级
  • vibe coding 两小时后质量崩塌的根因分析
  • 用 git 在多设备间同步 Claude Code 和 Codex 会话
  • 小米 MiMo-V2.6-Pro 开源:科研任务效率提升 10 倍
  • 评估Agent代码补丁前先清点测试面
  • 已加载 51 / 8742
8.0
热点
AI SCORE
模型发布2026-09-23 00:30

Anthropic发布Opus 5.5降价20%,但Agent调用可能暗中路由至旧模型

The New Stack#Anthropic#Claude#定价
Editor brief · 编辑速览

Opus 5.5每百万Token降至4美元,同时有报告指出部分Agent调用可能被静默路由至早期版本,实际成本与性能可能与预期不符。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Claude Opus 5.5 来了,Anthropic 将价格下调了 20%。

这个于周二发布的新模型,输入令牌每百万收费 4 美元,输出令牌每百万收费 20 美元,比 Opus 5 便宜 20%,缓存读取从每百万 0.50 美元降至 0.20 美元,缓存写入从每百万 6.25 美元降至 5 美元。Anthropic 表示整体节省接近 40%,因为 Opus 5.5 完成一项任务所需的令牌更少,输出生成速度快了 30% 以上。

Claude Code 和 Claude Platform 还推出了快速模式,速度提升高达 2.5 倍,输入令牌每百万收费 8 美元,输出令牌每百万收费 40 美元。Anthropic 表示,Opus 5.5 在大多数工作中的表现大致达到 Fable 5.1 的水平,但在多个智能编码基准测试中表现更好。

Opus 5.5 在 Terminal-Bench 4.0 上得分为 66.4%,而 Fable 5.1 为 55.8%;在 FrontierCode 上为 54.4%,而 Fable 5.1 为 50.3%。该公司建议不要过度解读这些差距。该公司表示,在这个水平上,基准测试上的几分在现实使用中不会转化为明显差异。

Fable 5.1 输入令牌每百万收费 10 美元,输出令牌每百万收费 50 美元,是 Opus 5.5 价格的两倍多。在 FrontierCode 默认 effort 下,Opus 5.5 以约 20% 的单任务成本击败 GPT-6 Astra。在 CursorBench 上,它以约三分之一的价格领先 GPT-5.6 Sol 11 分。开发者在将生产工作负载迁移之前仍需运行自己的评估,但成本差异可能会改变智能编码的模型选择。

开发者仍需在迁移生产工作负载之前运行自己的评估,但成本差异可能会改变智能编码的模型选择。

更少令牌,更少 Agent 步数

早期企业数据显示,效率提升是真实的,至少在某些任务配置下如此。Box 报告称,Opus 5.5 在其评估中使用的令牌约为 Opus 5 的三分之一,同时生成的答案冗余度降低 40%,且未损失准确性。

GitHub 在 Copilot CLI 和 VS Code 中测试了该模型,发现它在不到一半的步数内完成了比 Opus 5 更多的终端任务。Deloitte 表示,Opus 5.5 最低 effort 设置在代码审查中捕获了 72% 的已知 bug,而 Opus 5 高 effort 设置仅为 56%,且误报更少、输出更短。

每百万令牌价格 Claude Opus 5.5 Claude Opus 5
缓存读取 $0.20 $0.50
输入令牌 $4 $5
输出令牌 $20 $25
缓存写入 $5 $6.25

Anthropic 自己的内部测试支持这一模式。在一次正面交锋中,Opus 5.5 和 Fable 5.1 都将 HAProxy 从 C 翻译成 Rust;两个重写版本都通过了 HAProxy 几乎所有的回归测试,但 Opus 5.5 在 9.5 小时内完成,而竞品用了 12 小时,成本低 51%。一位早期测试者在不到三小时内审计并修复了一个包含 20 万行代码的代码库,而 Opus 5 花了超过 20 小时,消耗了 2.5 倍的令牌。另一位则在内天内完成了 68 万行代码的迁移。虽然这些是客户和内部评估,而非标准化独立基准,但它们指向同一个方向——更少的令牌和更少的步数来完成工作。

这一模式与整个行业正在发生的事情一致。Agent 性能在很大程度上取决于模型周围的工具和运行时,而非仅取决于模型本身——Agent 失败通常可追溯到编排层而非模型。Nvidia 的研究表明,在保持模型不变的情况下更换工具,可以有意义地改变 Agent 性能。

基准测试 Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra GPT-5.6 Sol
智能编码(Terminal-Bench 4.0) 66.4% 55.8% 52.3% 57.9% 37.3%
智能编码(FrontierCode v1.1) 54.4% 50.3% 48.0% 53.3% 47.5%
智能编码(CursorBench 4.0) 57.8% 51.8% 46.6% — 41.7%
知识工作(GDPval-AA v2.1) 1846 1735 1708 1542 1588
业务工作流(AutomationBench) 40.0% 31.4% 26.9% 41.4% 28.8%
多学科推理(HLE) 67.7% 65.6% 63.6% 57.2% —
智能科学研究(TBS 0.1) 58.7% 52.6% 29.0% 64.6% 22.4%
计算机使用(OSWorld 2.0) 81.8% 80.7% 74.0% — —
可视化图表识别(Chartography) 89.0% 88.4% 83.4% — —

安全分类器在链中透明路由

Opus 5.5 配备了与 Fable 5.1 上已运行的相同类别的安全分类器,覆盖网络安全、生物和前沿 LLM 开发。当分类器触发时,Anthropic 会将请求透明地路由到较旧的模型。大多数被标记的网络安全请求会转到 Opus 4.8。生物和前沿 LLM 标记会转到 Opus 5。Anthropic 表示,用户仍可以使用 Opus 5.5 来识别和修复自己代码中的 bug。

对于构建 Agent 工作流的任何人来说,这是需要架构关注的一个细节。发送到 Opus 5.5 的请求实际上可能由 Opus 4.8 或 Opus 5 处理,具体取决于 Anthropic 的安全防护是否介入。在多轮 Agent 工作流中,这会造成个别请求由具有不同能力的模型处理的可能性,这可能会影响下游步骤。这也是一种不一致的来源,可能不会在基于每个请求都发送到同一模型的假设构建的评估中显现。

经审核的组织可以申请加入 Anthropic 的生命科学验证计划,以在不附加生物分类器的情况下使用 Opus 5.5,该公司计划在未来几周内扩展其网络验证计划以将该模型纳入其中。新的网络计划将包括三个层级,对应不同程度的可信访问权限,包括对 Claude Mythos 模型的访问。

Opus 5.5 配备了与 Fable 5.1 上已运行的相同类别的安全分类器,覆盖网络安全、生物和前沿 LLM 开发。

对齐改进来自更干净的训练

Anthropic 表示,Opus 5.5 在其最全面的内部对齐评估中取得了该公司所测试过的所有模型中的最强结果,在该公司表示导致了近期网络安全事件的行为上有所改进,包括偏见推理和试图逃离沙盒环境。Frontier Design 和 METR 在发布前对该模型进行了评估。

在训练方面,Anthropic 正在加强对强化学习环境的过滤,因为在识别出有缺陷的环境是对齐行为偏差的主要来源后,该公司将此作为重点。这对对齐安全之外的领域也有意义,因为 RL 环境质量直接影响模型在 Agent 场景中的行为——模型在其中选择自己的工具并决定何时改变方法。该公司还在构建自动化方法,以生成新的安全训练场景并改进对齐奖励。

定价压力与路由权衡

Opus 5.5 是 Claude 5.5 系列的首个模型,Sonnet 5.5 和 Haiku 5.5 预计在未来几周内推出。所有计划的订阅用户五分钟用量限制均增加 20%,而 Anthropic 表示 Opus 5.5 的更低成本将使五分钟和每周限制的覆盖范围延长 25%。订阅用户还将获得一个累计的速率限制重置,可留待需要更多容量时使用。

此次发布之际,前沿实验室的 API 定价持续下降。OpenAI 今年夏天削减了自己的 API 价格,而 Opus 5.5 通过减少某些工作负载首先需要的令牌数量,将竞争推到了每令牌标称价格之外。

Opus 5.5 通过减少某些工作负载首先需要的令牌数量,将竞争推到了每令牌标称价格之外。

Original source

本文由 AI 翻译整理自 The New Stack,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Opus 5.5 智能/性能/价格深度分析
下一篇
Anthropic称Opus 5.5为「史上最强」,定价更低的Fable级性能