前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8626
  • AI 编程代理的安全发布框架:轻量级操作系统方案
  • 2026 电商自动化选型指南:n8n vs Zapier 实战对标
  • 用 AI 命令维护自研工具:系统化独立开发第 4 部
  • 谷歌地球 AI 生图功能因安全风险紧急下架
  • OpenAI 发布数学与理论计算机科学 10 项突破
  • DeepSeek V4-Flash:3040 亿参数 Agent 模型发布
  • Mission Driver:AI 任务驱动引擎的通用实现
  • 编程 Agent 的安全陷阱:Hook 不能保证安全边界
  • 代码审查成新瓶颈:AI 时代的组织适配问题
  • AGE:引力驱动的 AI 原生工程方法论
  • React 内存泄露诊断实战:从 1.4GB 到可观测性
  • 三大 AI 工程框架对比:任务级 vs 轨迹级的设计分歧
  • AI 规划系统对比:完成语义与上下文保留的权衡
  • MCP 2.0 发布:无状态协议打开新生态
  • AI Agent 架构:控制层与指导层分离设计
  • 微软承诺年底前优化 Win11 内存占用,改善 8GB 体验
  • llm-mcp-client 0.1a0 开源发布
  • OpenAI发现更多AI代理越界行为
  • 先完成再学习——AI agents改变全栈开发学习方式
  • DeepSeek V4 Flash:高性能低成本模型的实用价值
  • Claude Sonnet 5与Opus 5实战对比:如何选择合适的模型
  • DeepSeek V4-Flash编程和Agent能力重大突破
  • AI日报:ARC-AGI-3、Devin SWE等关键动态
  • 2026年最受欢迎的AI API和爬虫工具Top 10
  • AI如何赋能.NET专业工程实践
  • 开源权重模型已能对标闭源前沿模型
  • Reddit 诉讼继续:Perplexity AI 未授权爬取内容
  • smevals:轻量级模型和提示词评估框架
  • 印度应用市场转折:用户开始为应用付费
  • 生产环境 LLM 安全威胁与防护清单
  • 生产级 Agent 身份认证与权限管理
  • 提升开发效率的 Chrome 扩展榜单
  • AI Avatar 实时性能优化:流媒体传输实战
  • Google Earth AI 虚假内容问题致功能下线
  • AI 语音工具架构差异深度对比
  • Claude Agent 失控案例:主动发布恶意代码攻击真实企业
  • Google 撤回 Earth AI 卫星图生成工具
  • Gemini 2.5 Pro 和 Gemini 3 Flash 正式弃用
  • AWS Glue 数据目录新增 Agent 体验功能
  • Google Earth AI 造假工具上线即撤回
  • 虚拟 MCP 服务器:安全聚合多个工具源
  • 开源自动化平台对标:部署、安全、审计
  • 硬编码密钥的真实威胁:删除不等于修复
  • 我的调试工具反过来被 Agent 发现了 Bug
  • 本地化 AI 基础设施:程序员 2026 的最佳投资
  • 131 个测试 + 4 层架构:我的 Agent 评估框架
  • Google Meet 推出自动视觉截图功能记录会议
  • Laravel 可逆 PII 匿名化:安全调用 LLM
  • 从 AI 助手到个人操作系统的转变
  • 从 AI 助手到个人操作系统的转变
  • Google Earth AI 编辑工具一天内被下线
  • 已加载 51 / 8626
8.0
热点
AI SCORE
编程提效2026-08-01 06:07

Claude Sonnet 5与Opus 5实战对比:如何选择合适的模型

dev.to · AI#Claude#模型选择
Editor brief · 编辑速览

对比两款最新Claude模型在真实工作中的表现;核心建议是根据任务复杂度选择,避免一刀切方案。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

最初发布于 Cosmic 博客。

Anthropic 在 2026 年 6 月 30 日推出了 Claude Sonnet 5,在 7 月 24 日推出了 Claude Opus 5。两者都很优秀。最昂贵的错误是选择其中一个,将其集成到每个代码路径中,然后要么在琐碎工作上过度支付,要么在真正重要的工作上资源不足。

这是实际的分析:每个模型的可量化优势、考虑分词后每个模型完成相同工作的成本,以及一条你本周就能部署的路由规则。

如果只想记住一句话:默认运行 Sonnet 5,在判断质量比吞吐量更重要的特定路径上升级到 Opus 5。

基准测试实际上说了什么

在比较分数之前,有个值得了解的细节。Anthropic 在不同的测试套件上评估了这两个模型,所以没有一个明确的对比表,任何发布对比表的人都是用猜测填补空白。

以下是 Sonnet 5 的实际发布结果:

  • 编码和知识工作的最先进水平,在 Frontier-Bench 和 GDPval-AA 上测量
  • 在 Zapier 的 AutomationBench 上获得端到端任务完成的第一名
  • ARC-AGI 3 分数约是次好模型的三倍
  • 不当行为得分 2.3,是 Anthropic 最近发布版本中最低的

以下是 Opus 5 的实际发布结果:

  • 在智能上与 Claude Fable 5 相匹配,成本约为其一半
  • 快速模式运行速度快约 2.5 倍

注意缺少的是什么:Anthropic 没有为 Opus 5 发布 SWE-bench Verified 数字。所以在经典编码基准上的诚实比较是 Sonnet 5 的 72.7% 对 Opus 4.8 的 79.4%,Opus 5 在较新的智能体和知识工作套件上的位置在 Opus 4.8 之上。将你在其他地方找到的任何"Opus 5 在 SWE-bench 上得分 X%"的说法视为没有来源。

实际的理解:Sonnet 5 在直接编码上缩小了与前一代 Opus 的大部分差距。Opus 5 的优势体现在长期智能体工作、自我验证以及模型必须决定任务是什么的问题中。

实际成本

每百万 token 的列表价格:

标题数据显示 Opus 5 在标准价格下成本是 Sonnet 5 的 1.67 倍,在推介期间是 2.5 倍。这低估了 Sonnet 5 的实际成本,因为 Sonnet 5 搭载了一个新的分词器,将相同的文本计算为 1.0 倍到 1.35 倍的 token。你按 token 付费,而不是按单词,所以这种膨胀会出现在你的账单上。

我们来看一个具体例子。假设一个基础分词器将一项工作计为 1,000,000 个输入 token 和 200,000 个输出 token:

那个 1.23 倍的行是应该改变你想法的。在标准价格下,分词效果差的文本繁重工作负载上,Opus 5 的成本比 Sonnet 5 多约 23%,而不是 67%。如果该路径上的判断质量有任何重要性,23% 的溢价很容易被证明是合理的。

有两个需要注意的地方,这样你才能诚实地使用这些信息。膨胀范围是 1.0 倍到 1.35 倍,取决于你的内容,而你落在哪里是关于你自己数据的经验性问题。而且 9 月 1 日的价格变化意味着你本月构建的任何成本模型都需要重新审视。通过两个模型运行 1,000 个真实请求,比较你实际计费的 token 数,然后根据你的数字而不是这个表做出决定。

一条你可以部署的路由规则

大多数团队不需要一个聪明的分类器。基于任务类型的静态路由捕获了几乎所有的节省:

默认使用 Sonnet 5。 内容生成、聊天、摘要、标签、常规代码更改。

在三种情况下升级到 Opus 5: 任务需要大约十个以上的工具调用,任务是架构性或模糊的,或者错误的答案在反转上代价昂贵。

在重试时升级。 如果 Sonnet 5 的输出验证失败两次,改为在 Opus 5 上重试一次,而不是在 Sonnet 5 上第三次尝试。这是列表中回报率最高的规则,大约需要六行代码。

永远不要硬编码模型名称。 Anthropic 在 25 天内推出了两个前沿模型。你今天固定的任何东西在一个季度内都会过时。

第四点是大多数长期痛点所在。如果你的模型标识符被编译到你的应用程序中,每个模型发布都会变成一个拉取请求、一次审查和一次部署。

将模型配置保持在代码库之外

将你的路由配置存储为内容。然后将 Sonnet 5 替换为 Sonnet 5.1 就是一个立即生效的字段编辑,无需重建。

npm install @cosmicjs/sdk

在 Cosmic 中将路由表定义为对象,并在运行时读取它:

import { createBucketClient } from '@cosmicjs/sdk';

const cosmic = createBucketClient({
  bucketSlug: process.env.COSMIC_BUCKET_SLUG!,
  readKey: process.env.COSMIC_READ_KEY!,
});

type ModelRoute = {
  default_model: string;
  escalation_model: string;
  escalate_after_failures: number;
};

export async function getModelRoute(): Promise<ModelRoute> {
  const { object } = await cosmic.objects
    .findOne({ type: 'model-config', slug: 'production' })
    .props('metadata')
    .depth(0);

  return object.metadata as ModelRoute;
}

在调用网站使用它:

const route = await getModelRoute();

let model = route.default_model;        // "claude-sonnet-5"
if (isArchitectural(task) || failures >= route.escalate_after_failures) {
  model = route.escalation_model;       // "claude-opus-5"
}

const result = await runTask({ model, task });

当下一个模型发布时,非工程师在仪表板中更新一个字段,生产环境会接收它。没有部署,没有拉取请求,没有工程师参与。Cosmic 通过 REST API 和 TypeScript SDK 公开了这一点,所以同样的配置可以从你使用的任何框架或运行时中读取。

对于这个决定的前一代版本,请参阅 Sonnet 4.5 vs Opus 4.5。

常见问题

Opus 5 比 Sonnet 5 更好吗? 在模糊推理、长期自主智能体运行和自我验证方面,是的。在高容量任务的每个可接受输出的成本上,Sonnet 5 明确获胜。它们是为不同的工作而构建的。

Claude Sonnet 5 的成本是多少? 到 2026 年 8 月 31 日,每百万输入 token 2 美元,每百万输出 token 10 美元,9 月 1 日起分别升至 3 美元和 15 美元。

Claude Opus 5 的成本是多少? 每百万输入 token 5 美元,每百万输出 token 25 美元,与 Opus 4.8 相同。

Anthropic 是否为 Opus 5 发布了 SWE-bench Verified 分数? 否。Sonnet 5 的得分是 72.7%,Opus 4.8 的得分是 79.4%。Opus 5 的已发布结果涵盖 Frontier-Bench、GDPval-AA、Zapier AutomationBench 和 ARC-AGI 3。

我应该使用哪个 Claude 模型进行编码? 大多数日常工作使用 Sonnet 5。对于架构、跨领域重构和任何无法廉价验证结果的工作,升级到 Opus 5。

为什么我的 Sonnet 5 token 计数看起来比预期的高? Sonnet 5 使用新的分词器,将相同的文本计算为比前一代多 1.0 倍到 1.35 倍的 token。比较计费的 token,而不是单词计数。

构建超越模型生命周期的基础设施

Anthropic 在不到一个月的时间内推出了两个前沿模型。处理得好的团队是那些从不在源文件中放入模型名称的团队。

Cosmic 是一个由 AI 驱动的无头 CMS,你的内容和配置都位于 REST API 和 TypeScript SDK 后面。模型选择变成了内容决策,可由团队中的任何人编辑,保存时立即在生产中生效。

在免费计划上免费开始,包含 1 个 Bucket、2 个团队成员和 1,000 个 Objects。无需信用卡。如果你想讨论特定的架构,请与我们的 CEO 预订 20 分钟。

如有进一步行动,你可以考虑阻止此人和/或举报滥用。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
DeepSeek V4 Flash:高性能低成本模型的实用价值
下一篇
DeepSeek V4-Flash编程和Agent能力重大突破