前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯8957
  • FORGE多Agent研究系统的设计复盘:运行即日志
  • OpenAI 智能体暴力破解 UN 网站 API 字段
  • llama.cpp 实现提示词查找草拟加速 42 倍
  • OpenAI和Anthropic正调查数万起AI安全事件
  • OpenAI因AI失控再次暂停最强模型训练
  • 用Erlang/OTP思维构建Agent系统
  • Mac本地跑AI模型:内存与模型规模对照表
  • OpenAI Codex Agent失控:单次任务消耗7.8万美元
  • AI Agent安全防护:威胁模型与关键控制措施
  • Go语言廉价RAG实战:从每轮50美分降至4美分
  • 上下文窗口才是 AI 回答质量的瓶颈
  • 研究:接入AI后人们几乎不再说"我不知道",正确率反而下降
  • OpenAI暂停最强模型训练:模型突破控制
  • 125B MoE模型本地运行:3090三卡80 tokens/s优化实践
  • Claude攻克物理学九圈计算难题破世界纪录
  • 开源:Claude Code技能——自动分析国际象棋对局
  • Opus 5.5 Agent 爱汇报不干活?官方三招修复
  • Agent安全新思路:用短期可撤销凭证构建独立身份
  • 给 AI Agent 分配独立邮箱,处理每封邮件都视为不受信输入
  • AI 功能无声失败 26%:用 Eval Harness 捕获 LLM 输出退化
  • Claude Opus 5.5对比 Opus 5:更便宜更快但推理能力未提升
  • Codex报SKILL.md无效?原来是文件描述符耗尽
  • OpenCode永久提供DeepSeek V4.1 Flash 60美元额度
  • Nvidia SoL-Pi系统让编程Agent token消耗减半
  • 开发者亲测一个月停用AI:编码速度下降但深度思考回归
  • GPT-6 Astra八成准度识别宜家家具组装错误
  • Together AI 发布 17 美元微调分类模型完整配方
  • 长对话 LLM Token 成本优化:缓存何时有效何处失效
  • 上下文工程:别把百万 Token 当存储桶用
  • OpenAI最强大模型因Agent安全漏洞被暂停
  • 笔记本跑 7000 亿参数 GLM:用 SSD 当显存火爆 GitHub
  • Exa发布Agent Ultra:子代理蜂群API,超越GPT-6/Astra等四大基准
  • 谷歌TPU运行Kimi推理速度快57%,采用DeepSeek框架
  • Claude Code突破5小时限制可优雅收尾
  • OpenAI Agent失控调用DeepSeek/Kimi,近百万条短链曝光
  • 美团LongCat-2.5-Preview:1.6T MoE大模型支持百万token上下文
  • Anchors 方法让 LoRA 微调灾难性遗忘降低 28 倍
  • AI 推理服务器实战:GPU 选型与云端部署指南
  • Meta Muse AI 助手被通过隐藏端点劫持
  • Ling Tiny 3.0:CPU笔记本跑出实用代码助手
  • OpenAI智能体擅传53张客户图片至公网,已承认违规
  • GitHub Copilot企业托管配置支持内联验证
  • Liquid AI发布LFM2.5-VL-3B-DSpark:推测解码加速视觉模型达3倍
  • FTC主席:AI开发者应为代理行为承担法律责任
  • OpenAI智能体安全漏洞:53张用户图片被发布至公开网络
  • AI应用上线后高频故障模式分析
  • AI Agent与传统自动化的安全差异:控制权在哪里
  • 我的RAG评估骗了我两次
  • GitHub Copilot用量API新增PR评审耗时分析
  • OpenAI Agent入侵Hugging Face细节披露
  • Proaction借助OpenAI Codex实现销售额增长60%、节省75+工时
  • 已加载 51 / 8957
8.0
热点
AI SCORE
模型发布2026-09-26 21:00

Claude Opus 5.5对比 Opus 5:更便宜更快但推理能力未提升

The New Stack#Claude#模型评测#Anthropic
Editor brief · 编辑速览

Opus 5.5成本降低40%、速度更快,但在推理任务上并未超越Opus 5,benchmark测试显示两者差异不大。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Anthropic 本周发布 Claude Opus 5.5 时,宣称新模型成本比 Opus 5 低 40%,生成速度提升 30%。Anthropic 的营销提出了三个主张:Opus 5.5 达到了 Claude Fable 5.1 的水平(因此应该超越 Opus 5)、典型工作负载下成本比 Opus 5 低 40%、生成速度提升超过 30%。

Anthropic 还下调了开发者通过 API 使用模型的费用。Opus 5.5 的输入价格为每百万 token(每段文本约四分之三个词长)4 美元,输出价格为每百万 token 20 美元,而 Opus 5 为 5 美元和 25 美元。仅这一项降价就贡献了 20% 的节省。剩下的 40% 节省必须来自模型使用更少的 token。

我想看看这对普通 Claude 用户意味着什么,所以这次跳过了常规的开发者工作流模拟测试。近来我测试的模型在日常任务上表现都不错。推理任务是我见过它们吃力的地方,所以我只针对推理任务测试了 Opus 5 和 Opus 5.5。

如果你想在自己的系统上复现这些测试,可以在本文底部找到提示词。

我通过 Anthropic API 调用两个模型,使用完全相同的提示词。两个模型都以默认努力级别的自适应思考模式运行,因为 Opus 5.5 不允许关闭思考功能。每个问题每个模型只运行一次。我原本计划在模型给出不同结果时重新运行任何问题,但它们从未给出不同答案。

以下是我运行的测试:

逻辑网格(中等难度) — 七位工程师各自有一个值班日、一门语言、一个服务和一个城市,22 条线索锁定一个答案。六条线索是条件句或"恰好有一条为真"陈述,移除任何单条线索都会使谜题无法解开。

约束排序(困难难度) — 重新排列 10 个部署任务,使得没有任务留在原槽位,且没有两个连续编号的任务相邻。模型需要给出 6、8 和 10 个任务的计数。

记忆石子游戏(更难难度) — 玩家移除 2、5、7 或 11 颗石子,但不能重复对手上次移动的步数或自己上次的步数。模型需要找出从 200 颗石子开始谁赢、统计到 500 为止的失败起始数量,以及命名 340 以上最小的失败数量。

我对每次调用记录了输入 token 数、输出 token 数、按标价计算的花费和时间。思考 token 按输出计费,所以我将其包含在内。

测试结果

逻辑网格

两个模型都答对了全部 28 个单元格。Opus 5.5 用时 65 秒,输出 7,573 个 token,花费 $0.16。Opus 5 用时 108 秒,输出 10,621 个 token,花费 $0.27。

在这个测试中,Opus 5.5 便宜了 43%,得到了相同的正确答案。Opus 5.5 稍微更详细,指出它没有完全证明解是唯一的。

约束排序

两个模型都没有给出答案,这使其成为实际意义上最难的题目。正确答案是 27、1,695 和 159,019。第三个答案很难仅靠推理得出。能够检查每种排序的计算机程序可以找到它,但两个模型在这个测试中都无法运行代码。

在 48,000 token 的输出限制下,两个模型用光了全部预算进行思考,始终没有回复。Opus 5.5 用时 489 秒,花费 $0.96。Opus 5 用时 553 秒,花费 $1.20。

我将限制提高到 128,000 token 并重新运行。Opus 5 用尽了每个 token,用时超过 25 分钟,最终没有答案就停止了。花销 $3.20。Opus 5.5 运行了 19 分钟,使用了 112,733 个 token,但 API 以"拒绝"作为停止原因结束响应,没有附带任何文本。提示词要求模型计数任务排序,不包含任何敏感内容。这意味着拒绝很可能是 Anthropic 安全过滤器的误报,标记了一个无害请求。

Opus 5.5 更便宜,但如果拿不到结果,那便宜又有什么意义?

石子游戏

我们又回到了相同的答案。两个模型都正确回答了全部三部分。从 200 颗石子开始,先手输;从 120 到 500 的起始数量都是失败,340 以上最小的失败数量是 344。

这次测试的差异在于每个模型到达答案所需的思考量。Opus 5.5 用时 215 秒完成,输出 28,740 个 token,花费 $0.58。Opus 5 用时 624 秒,生成 74,981 个 token,花费 $1.88。Opus 5.5 少用了 62% 的 token,相同答案下成本降低了 69%。

测试 Opus 5.5 Opus 5
逻辑网格 28/28, 1:05, 908入/7573出, $0.16 28/28, 1:48, 906入/10621出, $0.27
排序问题(48k 限制) 无答案, 8:09, 235入/48000出, $0.96 无答案, 9:13, 233入/48000出, $1.20
排序问题(128k 限制) 无答案(拒绝), 18:56, 235入/112733出, $2.26 无答案, 25:24, 233入/128000出, $3.20
石子游戏 3/3, 3:35, 323入/28740出, $0.58 3/3, 10:24, 321入/74981出, $1.88
总 token 1701入/197046出 1693入/261602出
总时间 31 分 45 秒 46 分 49 秒
总费用 $3.95($4入/$20出 每百万) $6.55($5入/$25出 每百万)

在所有调用中,Opus 5.5 每秒写入 103.4 个 token,Opus 5 为 93.1 个,因此 Opus 5.5 快了约 11%。它在单个问题上最大的速度领先是 19%,仍未达到 Anthropic 宣称的 30%。它最大的成本节省来自石子游戏,从 Opus 5 的 $1.88 降到 $0.58,节省了 69%。测试总花费为 $10.50。

结论

Anthropic 的基准测试显示 Opus 5.5 在编码、知识工作和推理方面领先于 Opus 5。我没有重新运行那些基准测试。我给两个模型出了完全相同的三个推理问题,它们的表现相当。两个模型都解出了逻辑网格和石子游戏,都在排序问题上失败了。

节省是真实的。Opus 5.5 在每个问题上都更便宜、更快完成,包括逻辑网格省 43%、石子游戏省 69%。大部分节省来自使用更少的输出 token。价格下调贡献了 20%。它的写作速度快了 11%,未达到 Anthropic 宣称的 30%。

如果你现在运行 Opus 5,请切换到 Opus 5.5。在困难的推理任务上花更少的钱、更少的等待时间,得到相同的结果。不过,要在困难问题上设置硬性输出限制并关注花费。两个模型都可能思考近 20 分钟或更久而不返回任何内容,如果你为每个 token 付费,这就是个问题。对于类似排序测试的计数问题,给模型一个代码执行工具,而不是指望它靠推理完成。

附录:测试题目

逻辑网格

七位工程师(Ana、Ben、Cy、Dee、Eli、Fay、Gus)共享一个值班轮换。每个人恰好在一周的某一天(周一到周日,周一最早,周日最晚)值班,没有两人同日。每个人写一门不同的语言(Go、Rust、Python、Java、Kotlin、TypeScript、C++)、拥有一个不同的服务(auth、billing、search、queue、cache、gateway、metrics)、在不同的城市(Berlin、Tokyo、Denver、Lagos、Sydney、Toronto、Mumbai)。

  • Java 开发者是 Gus。
  • TypeScript 开发者恰好在 queue 所有者两天后值班。
  • 恰好有一条为真:Berlin 的工程师拥有 billing,或者 C++ 开发者周一值班。
  • 恰好有一条为真:Tokyo 的工程师拥有 cache,或者 Tokyo 的工程师写 Rust。
  • 如果 Fay 周日值班,那么 Denver 的工程师不写 Kotlin。
  • 恰好有一条为真:Kotlin 开发者拥有 auth,或者 C++ 开发者是 Cy。
  • Tokyo 的工程师比 C++ 开发者这周更早值班。
  • Denver 的工程师不写 Python。
  • 恰好有一条为真:Go 开发者是 Ben,或者 gateway 所有者在 Berlin。
  • Ana 在 Mumbai。
  • TypeScript 开发者比 Fay 这周更早值班。
  • Sydney 的工程师比 billing 所有者这周更早值班。
  • gateway 所有者比 Kotlin 开发者这周更早值班。
  • 周日值班的人不在 Berlin。
  • Fay 和 Lagos 的工程师值班日相邻。
  • Eli 恰好在 auth 所有者三天后值班。
  • Lagos 的工程师写 Java。
  • 恰好有一条为真:search 所有者是 Eli,或者 cache 所有者是 Dee。
  • gateway 所有者和 Go 开发者值班日相邻。
  • Lagos 的工程师恰好在 auth 所有者四天后值班。
  • Lagos 的工程师拥有 metrics。
  • Mumbai 的工程师比 Python 开发者这周更早值班。

确定完整分配。在回复末尾,准确给出七行,每位工程师一行,按 Ana、Ben、Cy、Dee、Eli、Fay、Gus 的顺序,格式如下:

ANSWER: Name | Day | Language | Service | City

约束排序

构建系统有 n 个部署任务,编号为 1 到 n。原来,任务 k 运行在槽位 k。你将所有 n 个任务重新排列到槽位 1 到 n(每个槽位一个任务),遵守两条规则:

  • 没有任务运行在原槽位(任务 k 不在槽位 k)。
  • 连续编号的任务绝不能运行在相邻槽位(例如,任务 4 和 5 不能在槽位 i 和 i+1,无论顺序)。

对于 (a) n = 6、(b) n = 8、(c) n = 10,有多少种有效排序?

在回复末尾,准确给出三行,格式如下:

ANSWER a: <number>
ANSWER b: <number>
ANSWER c: <number>

记忆石子游戏

两位玩家用一堆石子玩游戏。他们交替回合。每回合,一位玩家恰好移除 2、5、7 或 11 颗石子,受两条规则约束:

  • 你不能移除与对手最近一回合移除的相同数量。
  • 你不能移除与自己最近一回合移除的相同数量。

(在游戏的第一回合,两条规则都不适用。在第二玩家的第一回合,只适用第一条规则。)你不能移除比堆中更多的石子。如果一位玩家在自己的回合没有合法移动,则输掉游戏。两位玩家都完美游戏。

(a) 从 200 颗石子开始,先手赢吗?

(b) 从 1 到 500(含)的起始堆大小中,有多少个先手输?

(c) 大于 340 的最小失败起始堆大小是多少?

在回复末尾,准确给出三行,格式如下:

ANSWER a: <yes or no>
ANSWER b: <number>
ANSWER c: <number>
Original source

本文由 AI 翻译整理自 The New Stack,原文版权归原作者所有。

阅读英文原文
上一篇
AI 功能无声失败 26%:用 Eval Harness 捕获 LLM 输出退化
下一篇
Codex报SKILL.md无效?原来是文件描述符耗尽