前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9013
  • 决策模型:只返回概率、拒绝生成文本的新范式
  • AI购物Agent遭评测攻击:恶意评论注入钓鱼
  • GPT-6 Astra百万token成本拆解:何时值得用
  • MCP 服务器悄然变更工具描述 = 你的 Agent 在执行未知指令
  • GitHub Copilot 已上线 Claude Sonnet 5.5
  • Claude Sonnet 5.5 编程 benchmark 暴涨 6 倍,成本降三成
  • Anthropic发布Sonnet 5.5:半价达到 Opus 水平
  • Claude Sonnet 5.5 发布:性价比翻倍
  • VoiceStudio: 开源全本地语音克隆,支持646语言和MCP
  • 企业级AI代理界面设计:让记忆成为第一公民
  • OpenAI代理绕过限制:通过DNS隧道实现隐蔽通信
  • IDE 不够用:构建 Agentic 开发环境 ADE
  • Agent 记住了修复方案却错了:AfterTrace 事件恢复工具
  • 代理工具调用经济学:告别靠猜
  • OpenAI代理利用Google安全游戏漏洞抓取UN数据
  • 小米 MiMo-V2.6 开源登顶 AA 指数,超越 Kimi K3
  • 代码生成自动化了,代码审查却没有:AI辅助PR的真相
  • Cloudflare推出cf CLI:Agent化的全API命令行工具
  • Nvidia在芯片层引入AI Agent看门狗:毫秒级隔离
  • pgEdge:AI 编程助手造的数据库分支无法合并,这才是设计原意
  • 月之暗面 Kimi K3.1 曝光:100 万 Token 上下文
  • Cloudflare 开源 Forge:自动生成 API SDK 和文档
  • 英伟达推 AI Agent 安全平台:毫秒级隔离失控 Agent
  • EmDash 1.0:面向Astro的安全开源CMS
  • Cloudflare Kitesurf浏览器升级:730K平台测试通过,支持WebMCP
  • Cloudflare 收购 VoidZero 后:JS 工具链提速 10 倍
  • RAG原理解析:从第一性原理出发
  • 16 岁少年用 AI 机器人 Antares 发现微软内部 API 漏洞:涉 17 万亿行数据
  • Nvidia推出Open Agent安全平台,管控越狱AI智能体
  • Holo4:通用计算机操作智能体的底层支撑
  • 英伟达发布 AI 智能体安全平台:毫秒级异常隔离
  • 用Termux在Android手机上搭AI开发服务器
  • NVIDIA开源OpenShell安全沙箱:给本地Agent施加真实运行时限制
  • OpenRig:用 YAML 定义多 Agent 团队,Claude Code 与 Codex 协同作战
  • Cursor+Claude Opus 4.6误删Railway生产数据库的完整事故报告
  • 官方发布Claude Opus 5.5 Prompt技巧指南
  • 已加载 36 / 9013
8.0
热点
AI SCORE
模型发布2026-09-29 02:02

Claude Sonnet 5.5 编程 benchmark 暴涨 6 倍,成本降三成

The Decoder#Claude#Sonnet#编程基准
Editor brief · 编辑速览

Sonnet 5.5 在 Terminal-Bench 编程测试从 10.3% 跃升至 70.6%,接近 Opus 5.5 水平,同时每个任务费用最多降低 30%,响应速度提升超 30%。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Anthropic 发布了 Claude Sonnet 5.5,生成速度提升超过 30%,通过更高效的 token 使用将每次任务成本削减最多 30%。

Sonnet 5.5 在编码和知识工作基准测试中表现大幅提升,在部分测试中以极低的成本几乎追平顶级 Opus 5.5。

该模型现已上线 AWS、Google Cloud 和 Azure。Anthropic 新增了针对网络安全风险和蒸馏攻击的防护措施。

Anthropic 发布了 Claude Sonnet 5.5,这是 Claude 5.5 系列的第二款模型。它生成速度提升超过 30%,每次任务成本降低最多 30%,在多项基准测试中几乎追平 Opus 5.5。

Opus 5.5 面向需要谨慎判断的复杂任务。Sonnet 5.5 则瞄准定义明确的日常工作,如修复 bug、撰写文档、制作演示文稿和创建电子表格。Anthropic 还宣布将在未来几周推出 Claude Haiku 5.5,该模型将专注于高吞吐量、低成本的使用场景。

有了 Fable、Opus 和 Sonnet,Anthropic 已经拥有了与 OpenAI GPT-6 Astra、Sol 和 Luna 对应的产品,后者引发了最新一轮的价格战。从大面上看,Opus 略高于 Sol,Sonnet 略高于 Luna,Fable 略高于 Astra,不过 Anthropic 各档位的定价都更高。同档位之间的性能差异很小,成本可能最终成为决定因素。Haiku 可以帮助 Anthropic 缩小这一差距。

编码性能大幅跃升

据 Anthropic 介绍,Sonnet 5.5 与前代之间性能差距最大的是编码领域。在面向 Agent 编码的 Terminal-Bench 4.0 测试中,Sonnet 5.5 达到 70.6%,而 Sonnet 5 仅为 10.3%。在 CursorBench 4.0(复现 Cursor 编辑器真实编码会话)中,Sonnet 5.5 得分 55.5%,Sonnet 5 为 34.1%,Sonnet 5.5 仅以 2 分之差落后于 Opus 5.5(57.8%)。

Anthropic 表示,在"High"档位下的 FrontierCode 1.1 中,Sonnet 5.5 得分比 Sonnet 5 高出 10 分,而每次任务成本约为前者的十五分之一。早期的测试者对该模型快速理解代码库的能力大加赞赏。Sonnet 5.5 批量处理工具调用的频率也高于前代,减少了所需步骤数。

推理强度有一个奇怪的例外。在最高努力等级"Max"下,Sonnet 5.5 在 FrontierCode 上的得分实际上反而低于"Xhigh"。Anthropic 解释说,在最大努力模式下,模型更频繁地触发代码审查功能,将工作分配给多个子 Agent。在某些情况下,这导致了超时或超出任务范围的变更,这两点都是 FrontierCode 会扣分的。

知识工作几乎追平 Opus 5.5

在 GDPval-AA(OpenAI 开发的知识工作基准测试,涵盖 44 个职业和 9 个行业的任务)中,Sonnet 5.5 得分为 1844 分,几乎追平 Opus 5.5(1846 分),比 Sonnet 5(1449 分)高出约 400 分。按 Anthropic 的数据,OpenAI 的 GPT-6 Sol 为 1487 分。在视觉图表识别测试 Chartography 中,Sonnet 5.5 从 15.6% 跃升至 61.6%。

¹ Opus 5.5 在 Terminal-Bench 4.0 中于"Xhigh"档位取得最高分。² Sonnet 5.5 在"Max"档位下 FrontierCode 得分低于"Xhigh"。³ Sonnet 5.5 的数据来自预发布版本,其中一个后续已修复的 bug 可能影响了结构化输出的结果。

早期测试者形容 Sonnet 5.5 是一位更自然的对话伙伴,对设计有感觉。Anthropic 声称,该模型可以重构用户界面、执行幻灯片模板,效果出色到几乎无需修改。

Anthropic 还表示,Sonnet 5.5 是首款仅凭截图就能通关《宝可梦:红》的 Sonnet 模型。OpenAI 的 Astra 最近在游戏基准测试中也展示了类似的进步。类似这样的任务在几年前还被认为是难题,通常需要定制算法。如今即便是产品线中的中端模型也能处理。

单位 token 价格不变,每次任务 token 更少

Sonnet 5.5 每百万 token 的价格与 Sonnet 5 相同:输入 token 2 美元,输出 token 10 美元,缓存读取 0.20 美元。Anthropic 表示,由于该模型每次任务使用的 token 更少,有效成本降低最多 30%。输出生成速度也提升超过 30%。独立测试仍有待验证这些说法。

与 Anthropic 的其他模型以及 OpenAI 的对标产品一样,Sonnet 5.5 提供了可调节的努力等级设置,让用户可以在输出质量和成本、速度之间权衡。Anthropic 表示,在低或中等设置下,Sonnet 5.5 已经在多项基准测试中超越了 Sonnet 5 的最佳成绩,而每次任务成本约为前者的十分之一。不过,为每个任务找到合适的努力等级,目前更多是门艺术而非科学。

更强模型的网络安全新防护

Claude Sonnet 5.5 现已登陆所有主流云平台,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。与 Opus 5.5 和 Sonnet 5 一样,Anthropic 提供该模型且承诺零数据保留。开发者可以通过 Claude Platform 使用模型 ID "claude-sonnet-5-5" 访问。

由于 Sonnet 5.5 在网络安全方面的能力远超其前代,Anthropic 首次为 Sonnet 系列模型增加了防护措施。涉及高风险网络安全任务的请求会被明显地重定向至 Sonnet 5。通过扩展的 Cyber Verification Program,符合条件的专业人员可以申请分级访问。

Anthropic 还添加了针对蒸馏攻击的安全分类器,与最强大型号所用的相同。这些措施是否真正有效,将在接下来几个月内见分晓。如果中国实验室一直在从这类攻击中获益,关闭这一途径可能会再次拉大与西方实验室之间的差距。

Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
GitHub Copilot 已上线 Claude Sonnet 5.5
下一篇
Anthropic发布Sonnet 5.5:半价达到 Opus 水平