Nvidia NeMo Switchyard 等路由框架将简单任务分配给便宜模型,仅将 7% 复杂调用路由到前沿模型,实现 74% 成本降低而准确率仅下降约 6%。
Nvidia 的 Switchyard 发布,与其说是开发者底层设施,不如说是一个关于利润的故事。
原文链接:https://deanlee.info/essays/model-routing-is-margin-routing/
Nemotron 3.5 Lightning 是 Nvidia 面向高容量 Agent 任务推出的廉价、快速端点。NeMo Switchyard 是更有意思的一层。它根据成本、延迟和质量,将 Agent 工作流中的每一步路由到更便宜或更强的模型。
这将模型选择变成了一个条件分配问题。企业并不真正想要 token,他们想要的是完成的工作、有界的延迟、更少的重试,以及清晰的审计轨迹。如果一个路由器能将常规轮次发送给更便宜的模型,并将前沿模型留给升级处理,那么前沿实验室仍然能为困难工作获得报酬——虽然可能失去了常规量。
发布数据来自厂商关联方,需要打个折扣。LangChain 报告称,在 145 个多轮任务中,通过只将 7% 的调用路由到前沿模型,实现了 74% 的成本降低,精确度折损约 6 个点。Ramp 报告称,在内部 SWE-Bench 上匹配前沿性能的同时,成本削减 58%,运行时间削减 33%。Cognition 报告称,在 Nvidia 内部用户的 Devin Desktop 测试中,以 28% 较低的均值成本实现了接近前沿的性能。
具体的百分比数字不如大方向重要。如果前沿调用变成异常容量而非默认容量,模型定价就开始越来越不像 SaaS 忠诚度,而更像执行场地经济学。
硬指标不是节省了多少 token,而是任务被接受后的总成本——包含重试、人工审核、延迟罚款和下游错误。一个造成昂贵清理工作的廉价模型并不便宜。一个能够衡量完整分布的路由器在经济上变得有价值。
这就是 Nvidia 处于有利地位的原因。它销售硬件、服务栈、开源模型,以及部分路由逻辑。如果更便宜的推理扩大了使用量,更多工作仍然会落在加速基础设施上。
我认为路由将成为企业 AI 架构的常规组成部分。也许不是 Nvidia 的路由器无处不在,也许也不是处处都能达到发布基准的经济效益。但一旦工作负载变得足够可重复测量,买家就会停止习惯性地将每一步都发送给最贵的模型。