NeMo Switchyard是嵌入Agent框架的模型路由库,搭配Nemotron 3.5 Lightning(30B MoE开源模型)使用。
路由正在下沉到技术栈底层
一周前,路由还是托管网关产品的卖点:8月4日,Google Cloud API Gateway 的模型路由进入公开预览阶段,同一天 Databricks Unity AI Gateway 也正式GA。紧接着8月11日,NVIDIA 走了条完全不同的路——把路由器开源了。NeMo Switchyard 是一个模型路由库,直接嵌入到 Agent 框架中,与 Nemotron 3.5 Lightning 同步发布——后者是一个 300 亿参数的 MoE 开源模型,专为高频工作流步骤打造。一天后,8月12日,Tetrate 将其 Agent Router 作为 VS Code 扩展发布:一个 API key 就能把 160+ 模型变成编辑器级别的共享资源。三条新闻,一个趋势:路由不再是网关产品的专利。它正在快速下沉——进入开源库、进入 Agent 循环、进入编辑器本身。
技术深挖:从按请求到按步骤
粒度跃迁:每个 Agent 步骤都值得拥有自己的模型
传统网关路由的决策粒度是请求级别:一个请求到来,分类器估算难度,流量被导向合适的模型。Agent 工作流完全不是这样。一个用户任务会展开成数十次模型调用——规划、工具调用、代码生成、测试、审查、修正。这些步骤的难度差异巨大。把它们全跑在一个模型上,要么为简单步骤支付前沿模型的价格,要么在困难步骤上输出质量下降。NeMo Switchyard 把路由决策推进到 Agent 循环内部:它自动为工作流的每一步选择最合适的模型,路由算法可沿质量、延迟和成本维度调优,跨越开发者运行的任何开源、专有和 NVIDIA 模型组合——无需重写应用。NVIDIA 内部基准测试:保持前沿级准确率的同时,任务完成成本降至单独跑 Opus 4.8 的约三分之一。合作伙伴 Boomi 的数据更具体:100% 的领域路由准确率,59% 的流量被分发到一个快 5 倍的模型上。
路由目的地:Nemotron 3.5 Lightning
路由器需要有值得路由的目标。Nemotron 3.5 Lightning 是一个 300 亿参数的 MoE 开源模型,职责明确:模型系统中的高频工作站。在 NVIDIA 的架构中,前沿推理模型(Nemotron 3 Ultra 或 GPT-5.6 级别)负责规划和编排,Lightning 则处理高容量的专业化步骤——代码审查、工具调用、安全告警监控、账单问答。官方数据声称比同类模型快 4 倍输出、Agent 任务完成快 30%。权重已在 Hugging Face、ModelScope 和 OpenRouter 上线,同时上线的还有 Nemotron-RL-Agentic-Terminal-Pivot——用于后训练其编码 Agent 技能的 RL 数据集。"一个前沿编排器加一群轻量专家"的架构正在从论文语言走向工厂默认配置。
另一端:编辑器和控制平面
Tetrate 在8月12日发布的 VS Code 扩展走了另一条下沉路径。它不是 BYOK 自定义端点(那只能服务聊天视图),而是注册为 Language Model Chat Provider(这是自 VS Code 1.104 以来的稳定 API),使模型成为编辑器级别的共享资源:聊天、Agent 模式,以及窗口中调用 vscode.lm 的每个扩展共享同一个 key,运行时可发现当前可达的 164 个模型。同时,Cloudflare 在8月7日将 Workers AI 和 AI Gateway 合并为统一控制平面,并预览了模型优先路由:声明你想要哪个模型,网关决定由哪个提供商提供服务。
稀缺资源已转移
把这三个故事放在一起,结论很清晰:路由算法本身正在商品化。可以自托管的开源库、内置路由的网关产品、原生的编辑器支持。但商品化的路由暴露了两个新的瓶颈:

自托管 Switchyard 路由器的第一天你就会发现:路由表里八个模型意味着八个供应商账户、八个 key、八张发票、八套限流策略、八条可用性曲线。路由器越智能,供应层的碎片化就越痛苦。
实践中:路由器决定"用哪个模型";统一供应层确保"所有模型都可到达"
这正是模型接力服务的用武之地。wrouter.ai 提供一个 OpenAI 兼容的入口:完整的模型目录(前沿和主流开源模型在同一列表中)、稳定的服务(无需处理每个供应商的限流或故障转移逻辑)、统一计费(一个账户展示每一步在哪个模型上花了多少钱)。你的路由逻辑——Switchyard 或手写规则——只需要输出一个模型名;其余都通过同一个 base_url:
from openai import OpenAI
client = OpenAI(
base_url="https://wrouter.ai/v1",
api_key="YOUR_WROUTER_KEY",
)
# The router picks a model per workflow step; the supply layer never changes
STEP_MODEL = {
"plan": "claude-opus-5", # planning: frontier model
"code": "deepseek-v4", # codegen: price-performance tier
"review": "nemotron-3.5-lightning", # high-volume review: lightweight specialist
}
def run_step(step: str, messages: list):
return client.chat.completions.create(
model=STEP_MODEL[step],
messages=messages,
)
切换模型只需改映射表的一行,而不是新建供应商账户;月末对账是一张账单,而不是八份 CSV 导出。
随着路由从产品功能变成开源组件,竞争的核心从"谁能分流流量"转移到"路由器背后的模型目录谁的更完整、更稳定、更容易核算"。如果你在为 Agent 工作流构建按步骤路由,先把供应层统一到一个入口——前往 wrouter.ai,把你的路由表指向它。
NVIDIA: Nemotron 3.5 Lightning and NeMo Switchyard — https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/
Tetrate: Agent Router as a VS Code model provider — https://tetrate.io/blog/tetrate-model-provider-vscode-extension
Cloudflare: Unifying Workers AI and AI Gateway — https://blog.cloudflare.com/workers-ai-gateway-unification/
Google Developers Blog: API Gateway model routing public preview — https://developers.googleblog.com/en/a-unified-api-for-ai-model-routing/
RuntimeWire: Analysis of Cloudflare's unified control plane — https://runtimewire.com/article/cloudflare-unifies-workers-ai-ai-gateway-control-plane