前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8742
  • GitHub Copilot应用支持OpenTelemetry可观测性配置
  • 两款 AI 代码审查基准测评结论相反
  • AI 编码提速后:验证环节成为新瓶颈
  • AI 审查同一 PR 给出不同结论:确定性判定器来解决
  • AI计量工具审计启示:独立交易ref是防重复计费的关键
  • OpenAI发布GPT-6 Sol/Luna:API价格下调50%
  • GPT-6/Claude 5.5 同日发布:价格战开打,Luna 成本腰斩
  • GitHub Copilot 大幅提升C++代码索引速度
  • Anthropic和OpenAI同时推出性价比新模型
  • GPT-6 提示缓存重大升级:更高命中率与可诊断性
  • 六边形架构的端口在撒谎:HTTP 不等于业务语义
  • GPT-5.6 价格策略解读:Luna 降价 80%,多版本差异化定位
  • 高通骁龙8 Gen6端侧跑300亿参数MoE模型,吞吐330 Token/s
  • Claude Opus 5.5评测:智商极高但费用惊人
  • 小米开源 MiMo-V2.6:万亿参数开源模型登顶榜
  • AI Agent 工具 API 设计指南
  • 一个浏览器扩展权限即可劫持五大 AI Agent
  • Claude Opus 5.5 主打端到端代码补全而非起步
  • GPT-6 Sol发布:对齐能力逼近Astra,价格仅五分之一
  • GPT-6 Sol/Luna编程能力比肩Claude,成本降80%
  • Claude Opus 5.5发布:性能对标Fable 5.1,成本低40%
  • Claude Opus 5.5:编程修复成功率达97.5%,成本降40%
  • 开源工具llm 0.36支持GPT-6 Sol/Luna
  • JetBrains押注Agent开发:称其为26年最重要一步
  • 为 AI 代理添加预算守卫的实战方案
  • OpenAI GPT-6 Sol和Luna模型上线Amazon Bedrock
  • OpenAI发布GPT-6 Sol和Luna,API价格减半
  • OpenAI 发布 GPT-6 Sol/Luna 模型,Token 价格减半
  • GPT-6 Sol/Luna 正式发布:成本更低、错误更少
  • OpenAI 发布 GPT-6 Sol/Luna,主打低成本低幻觉
  • Claude Opus 5.5 登陆 Google Cloud,在 Model Garden 可用
  • Claude Opus 5.5 现已在 AWS Bedrock 可用
  • Strands Evals + Bedrock AgentCore:Agent 技能选择评估指南
  • llm-anthropic 0.29支持Claude Opus 5.5
  • Claude Opus 5.5发布:性能持平Fable 5.1,定价直降40%
  • GitHub Copilot上线Claude Opus 5.5,支持长时Agent任务
  • GitHub Copilot 新增 GPT-6 Sol/Luna 模型选项
  • Claude Opus 5.5 智能/性能/价格深度分析
  • Anthropic发布Opus 5.5降价20%,但Agent调用可能暗中路由至旧模型
  • Anthropic称Opus 5.5为「史上最强」,定价更低的Fable级性能
  • Anthropic 发布 Claude Opus 5.5:强化网络安全防护,遏制越狱行为
  • Claude Opus 5.5 正式发布:832 分成社区热议
  • 生产级 AI 语音 Agent 架构:WebSocket 与延迟优化实战
  • Permission Envelope:让 AI 权限自动过期的安全控制机制
  • llm-typesafe插件支持Jev模型二元判断
  • Python AI Agent 上线前必读:测试、可观测性与零成本方案
  • Cloudflare Worker Previews:为 Agent 每次变更提供隔离预览环境
  • NVIDIA Isaac ROS 5.0 发布:加速 Agentic 机器人开源开发
  • Meta Muse macOS 应用零日漏洞遭修复
  • 小米6天烧2000万训练开源模型MiMo,跃居开放模型榜首
  • LLM应用输入输出Guardrails实战指南
  • 已加载 51 / 8742
9.0
重磅
AI SCORE
模型发布2026-09-23 02:59

Claude Opus 5.5发布:性能对标Fable 5.1,成本低40%

MarkTechPost#Anthropic#Claude#大模型
Editor brief · 编辑速览

Anthropic发布Claude Opus 5.5,默认设置下运行成本比Opus 5低40%,编程基准测试中一日完成68万行代码迁移。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Anthropic 发布了 Claude Opus 5.5,这是其全新 Claude 5.5 系列的首款模型。团队表示,在大多数任务上其表现达到了 Claude Fable 5.1 的水平。同时在默认设置下运行典型工作负载时,成本比 Opus 5 低 40%。在 Anthropic 自有的基准测试中,它在代理编码、计算机操作和知识工作方面均处于领先地位。

可以部署吗?可以,作为托管 API 模型使用。Anthropic 未发布权重文件,因此不支持自托管。开发者可以通过 Claude Platform、Amazon Web Services、Google Cloud 和 Microsoft Azure 调用 claude-opus-5-5。与以往的 Opus 型号一样,支持零数据保留。

基准测试:领先明显,但非全面碾压

Opus 5.5 的分数采用自适应思考在最高努力级别下得出,同时启用了生产级安全防护。

基准测试 Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra
Terminal-Bench 4.0 66.4% 55.8% 52.3% 57.9%
FrontierCode v1.1 54.4% 50.3% 48.0% 53.3%
CursorBench 4.0 57.8% 51.8% 46.6% n/r
GDPval-AA v2.1 (Elo) 1846 1735 1708 1542
OSWorld 2.0 81.8% 80.7% 74.0% n/r
Terminal-Bench-Science 0.1 58.7% 52.6% 29.0% 64.6%
AutomationBench 40.0% 31.4% 26.9% 41.4%

Terminal-Bench 4.0 报告分数对应 Opus 5.5 的 xhigh effort 级别。GPT-6 Astra 在 Terminal-Bench-Science 和 AutomationBench 上仍处于领先。Zapier 运行 AutomationBench 时未使用 fallback 模型,因此安全防护介入被计为失败。Anthropic 同时提醒,基准测试的分数差距正在变得不那么可靠地反映实际体验——在其自身使用中,与 Fable 5.1 的差距比分数显示的要小。

成本调整后的结果更有说服力。在默认(medium) effort 下,Opus 5.5 在 FrontierCode 上得分为 54.6%,超越了 GPT-6 Astra 约 53.3% 的最高分,而每次任务的成本仅为其五分之一。在 CursorBench 上,medium effort 得分为 52.5%,比 GPT-5.6 Sol 最高的分数高出 11 分,成本却只有其三分之一。

Opus 5.5 所需算力低于 Opus 5,定价也相应体现这一点。

每百万令牌 Opus 5.5 Opus 5
输入 $4 $5
输出 $20 $25
缓存读取 $0.20 $0.50
缓存写入 $5 $6.25

缓存读取占据了大多数代理和编码任务的成本,而 Opus 5.5 的缓存读取费用下降了 60%。此外 Opus 5.5 每个任务消耗的令牌也更少。综合起来,实现了 40% 的成本降低。输出生成速度比 Opus 5 快 30% 以上。Claude Code 和 Claude Platform 的快速模式提供高达 2.5 倍的速度,每百万令牌收费 $8 输入/$40 输出。

Anthropic 还在上调 Pro、Max、Team 以及按席位计费的企业计划的五小时用量限制。订阅用户将获得一次可以保存并在之后使用的速率限制重置。

早期测试者报告

一位测试者在不到一天内完成了 68 万行代码迁移。

另一位测试者在不到 3 小时内审计并修复了一个 20 万行的代码库。Opus 5 则用了超过 20 小时,且消耗了 2.5 倍的令牌。

在一次 HAProxy 内部 C 到 Rust 的移植中,Opus 5.5 用了 9.5 小时完成。Fable 5.1 用了 12 小时,且 Opus 5.5 的成本低了 51%。

Deloitte 报告称,Opus 5.5 以最低 effort 捕获了 72% 的已知审查 bug,而 Opus 5 以最高 effort 仅捕获了 56%。

在一项难以获取的财报测试中,18 份 Opus 5.5 报告中 有 16 份通过了 Anthropic 的质量门槛。Fable 5.1 和 Opus 5 均从未做到。

写作风格也发生了变化。Opus 5.5 将关键信息放在首位,用更少的行话,并遵循你给出的写作规则。

安全性、安全防护与 API 变更

Opus 5.5 是 Anthropic 自 CEO Dario Amodei 呼吁为前沿模型发展「减速」以来发布的首款产品。外部评估方,包括 METR 和 Frontier Design,在发布前对其进行了测试。它在 Anthropic 自动行为审计(涵盖近 2000 个场景)中取得了迄今最高分。在一项新的 containment 测试中,它尝试规避边界的频率比 Opus 5 低约 85%。Anthropic 还指出,该模型经常怀疑自己正在被评估。

其生物和网络能力与 Claude Mythos 5.1 相当。因此 Opus 5.5 配备与 Fable 5.1 相似的安全防护:

网络安全:常规 bug 发现与修复正常工作。其他大多数网络安全任务会被重定向到 Opus 4.8。网络验证计划(Cyber Verification Program)将扩展至 Opus 5.5。

生物科学:经审核的组织可以申请生命科学验证计划(Life Sciences Verification Program)。

蒸馏:保留的思考过程(Preserved thinking)阻止 API 用户通过编辑先前的上下文来提取推理内容。该政策适用于 2026 年 8 月 31 日或之后创建的 API 账户。

还有两项变更影响集成:思考过程现在无法关闭;输出内容携带用于符合欧盟 AI 法案的水印。完整详情请参阅 Opus 5.5 System Card。

交互式解读

Opus 5.5 在大多数任务上与 Fable 5.1 持平,在几乎所有报告的基准测试中都击败了 Opus 5 和 Fable 5.1。

API 定价降至每百万令牌 $4/$20,缓存读取费用下降 60% 至 $0.20。

Anthropic 表示典型工作负载可节省 40%,输出速度比 Opus 5 快 30% 以上。

网络和生物请求触发 Fable 5.1 级别的安全防护,思考过程无法关闭。

闭源权重:claude-opus-5-5 通过 Claude Platform、AWS、Google Cloud 和 Azure 运行。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
GPT-6 Sol/Luna编程能力比肩Claude,成本降80%
下一篇
Claude Opus 5.5:编程修复成功率达97.5%,成本降40%