前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯4354
  • VentStream:开源 CDC 引擎实时同步数据库
  • MAI-Code-1-Flash:微软低成本编程模型解析
  • MAI-Code-1.1-Flash 登陆 GitHub Copilot
  • OpenAI 桌面应用 ChatGPT/Codex 正式登陆 Linux
  • 无人值守 AI Agent 的静默失败检测工具
  • 本地 AI 模型实战:量化版本性能对比与编程 Agent 集成
  • 深度推理系统的高成本困境:优化策略与定价模式
  • OpenAI/Anthropic/Google API漏洞:可提取模型推理痕迹,内含泄露密码
  • 跨机器AI Agent分析管道设计:五个架构模式
  • 持久化 Agent 运行时正在成为标配
  • WebMCP:给 Agent 结构化工具而非爬取 DOM
  • MCP Server 六大安全漏洞与修复方案
  • Node.js 工单分类:Claude/Gemini/OpenAI 实战对比
  • Databricks收购Electric:为每个AI Agent配置独立Postgres数据库
  • Context Rot:AI Agent 为何在长对话中质量下降
  • AI 编程工具为何总用废弃 API:根源分析与解决思路
  • 模型路由本质是利润率路由:成本与质量平衡实战
  • Nvidia 开源路由框架 NeMo Switchyard:让 Agent 工作流成本降至三分之一
  • MCP 缓存键是授权漏洞:六类缓存分离方案修复跨租户数据泄露
  • OpenAI Agents SDK 0.20.0 升级避坑指南
  • 亚马逊Nova Act助力QA自动化:自然语言描述测试,周期大幅缩短
  • AI 漏洞发现速度超越人类修复:安全格局重塑
  • AWS 企业级 Claude 应用网关部署完整参考
  • Claude Code 用户总结:CLAUDE.md 常见误区
  • AI 在安全测试中自主伪造身份企图植入后门
  • 构建可审计的深度推理 Agent 系统
  • AI 代码审查机器人工程实践:令牌定价、批处理与提示缓存
  • 构建安全 Agent 工作负载系统实战指南
  • 后端工程师 LLM 微调指南:行为适配而非知识填充
  • Meta Muse双模型实测:Glimmer 30B开源可本地跑,Spark 1.1称霸MCP榜单
  • 英伟达 Nemotron 3.5:小模型跑出高速度,36 亿参数追平 GPT-4 级能力
  • 用 TypeScript 构建 Prompt 缺失来源的三元分类队列
  • 用最便宜模型加路由实现 100% 有效输出的系统设计
  • 8款AI模型同一崩溃测试:没有赢家
  • AI Agent评测最高分居然是"拒绝回答"
  • 英伟达正在训练万亿参数开源模型Nemotron 4
  • Apple Silicon macOS 虚拟机:Llama.cpp 实现 11-16 倍 LLM 推理加速
  • 实测:16GB M1 Pro 笔记本跑本地 LLM 能跑多快
  • Zoom 会议工具被曝严重漏洞:20 个 AI 提示即可劫持设备
  • GitHub Copilot 使用报告支持按模型拆分 token 统计
  • 选择压力让基准测试变成模型的「指纹」
  • OpenAI GPT-5.6-Cyber:漏洞利用任务完成率达 95%
  • AI 代码审查的真实失败模式:不是幻觉而是忽略
  • NVIDIA Nemotron 3.5 Lightning 免费开放:30B MoE 适合 Agent 执行层
  • AI Agent 为何总忽略自己的指令:三个真正有效的修复方案
  • CI 变绿不等于修对了:AI 修复让 Stripe 发货变成零
  • AI 红队发现:小说框架下的恶意指令规避
  • 已加载 47 / 4354
8.0
热点
AI SCORE
技术实践2026-08-12 00:28

模型路由本质是利润率路由:成本与质量平衡实战

dev.to · AI#模型路由#成本优化#AI Agent
Editor brief · 编辑速览

Nvidia NeMo Switchyard 等路由框架将简单任务分配给便宜模型,仅将 7% 复杂调用路由到前沿模型,实现 74% 成本降低而准确率仅下降约 6%。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Nvidia 的 Switchyard 发布,与其说是开发者底层设施,不如说是一个关于利润的故事。

原文链接:https://deanlee.info/essays/model-routing-is-margin-routing/

Nemotron 3.5 Lightning 是 Nvidia 面向高容量 Agent 任务推出的廉价、快速端点。NeMo Switchyard 是更有意思的一层。它根据成本、延迟和质量,将 Agent 工作流中的每一步路由到更便宜或更强的模型。

这将模型选择变成了一个条件分配问题。企业并不真正想要 token,他们想要的是完成的工作、有界的延迟、更少的重试,以及清晰的审计轨迹。如果一个路由器能将常规轮次发送给更便宜的模型,并将前沿模型留给升级处理,那么前沿实验室仍然能为困难工作获得报酬——虽然可能失去了常规量。

发布数据来自厂商关联方,需要打个折扣。LangChain 报告称,在 145 个多轮任务中,通过只将 7% 的调用路由到前沿模型,实现了 74% 的成本降低,精确度折损约 6 个点。Ramp 报告称,在内部 SWE-Bench 上匹配前沿性能的同时,成本削减 58%,运行时间削减 33%。Cognition 报告称,在 Nvidia 内部用户的 Devin Desktop 测试中,以 28% 较低的均值成本实现了接近前沿的性能。

具体的百分比数字不如大方向重要。如果前沿调用变成异常容量而非默认容量,模型定价就开始越来越不像 SaaS 忠诚度,而更像执行场地经济学。

硬指标不是节省了多少 token,而是任务被接受后的总成本——包含重试、人工审核、延迟罚款和下游错误。一个造成昂贵清理工作的廉价模型并不便宜。一个能够衡量完整分布的路由器在经济上变得有价值。

这就是 Nvidia 处于有利地位的原因。它销售硬件、服务栈、开源模型,以及部分路由逻辑。如果更便宜的推理扩大了使用量,更多工作仍然会落在加速基础设施上。

我认为路由将成为企业 AI 架构的常规组成部分。也许不是 Nvidia 的路由器无处不在,也许也不是处处都能达到发布基准的经济效益。但一旦工作负载变得足够可重复测量,买家就会停止习惯性地将每一步都发送给最贵的模型。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
AI 编程工具为何总用废弃 API:根源分析与解决思路
下一篇
Nvidia 开源路由框架 NeMo Switchyard:让 Agent 工作流成本降至三分之一