NVIDIA发布轻量模型Nemotron 3.5 Lightning配合NeMo Switchyard,形成双模型组合方案——大模型负责规划、小模型处理高频工具调用,显著降本。
当人们谈论 AI Agent 时,对话通常围绕规划模型展开——也就是那个负责推理、分解任务、决定下一步做什么的前沿系统。但在实际运行中,一个 Agent 的大部分 token 预算其实消耗在远不那么光鲜的事情上:工具调用、结果验证、格式转换、子 Agent 委托。这些重复性、高频次的步骤维持着工作流的运转,而它们根本不需要一个 5500 亿参数的模型来处理。
NVIDIA 于 8 月 11 日发布的 Nemotron 3.5 Lightning 和 NeMo Switchyard,正是为了解决这种错配而生的。它们共同构成了一个实际问题的两部分答案:如何构建既强大又经济实惠的常驻型 Agent?
现代 Agent 系统越来越多地以「模型系统」的方式运作——即由不同模型处理工作流不同部分的集成系统。像 Nemotron 3 Ultra 或 GPT-5.6 这样的前沿推理模型可能负责编排复杂计划,但大量的实际工作——运行 git 命令、验证工具输出、回答计费问题、审查代码 diff——都是重复且定义明确的。
将所有这些执行流量都路由到前沿模型,代价高昂且速度缓慢。但如果路由到一个无法可靠遵循结构化指令或处理工具模式的模型,情况只会更糟。执行层需要一个快速、在约束任务上准确、并且成本低到可以大规模运行的模型。
这正是 Nemotron 3.5 Lightning 要填补的空白。
Nemotron 3.5 Lightning 是一个 300 亿参数的混合专家(Mixture-of-Experts,MoE)模型,每个 token 仅激活 30 亿参数。MoE 架构意味着一个学习到的路由器将每个 token 发送到少数几个专门的「专家」子网络,使得模型以 3B 的计算成本获得 30B 模型的表示能力。
该模型内置了多项推理优化:
通过多 token 预测(MTP)实现的投机解码(Speculative decoding)。在预训练期间,模型被训练为同时预测多个 token,而不仅仅是下一个 token。这使得推理时能够进行投机解码:draft 模型提出若干个 token,主模型并行验证它们——显著提升吞吐量。NVIDIA 随 Lightning 一起发布了两个 draft 模型:DSpark(针对 DGX Spark 上的低并发工作负载优化)和 DFlash(更适合高并发场景)。
NVFP4 量化。模型同时提供 BF16 和 NVFP4 两种 checkpoint。NVFP4 使用 4 位浮点表示,配合专用内核,可运行在 NVIDIA Blackwell、Hopper 和 Ampere GPU 上,在大幅降低内存占用的同时实现近无损性能。
基于 Harness 优化的训练。模型针对流行的 Agent harness 进行了专门训练,如 OpenClaw 和 Hermes Agent,这意味着它被调优为输出这些框架期望的结构化结果——减少生产环境中的解析错误和重试循环。
根据 NVIDIA 的 PinchBench 基准测试,Lightning 在 Agent 任务上达到了 86% 的准确率,同时以与 Qwen3.6 35B 相当的准确度完成 10000 个任务,速度快 30%。在 Artificial Analysis Intelligence Index——即聚合了 Agent 任务、编码、科学推理和通用智能九项评估的综合指数——上,Lightning 处于其同级别模型的准确率-速度 Pareto 前沿。
拥有一个快速的执行模型只是问题的一半。另一半是在运行时决定哪些请求应该发给 Lightning、哪些应该发给前沿模型。这正是 NeMo Switchyard 所做的事情。
Switchyard 是一个开源模型路由库,可与现有 Agent 框架集成——LangChain、LiteLLM、Kong AI Gateway 等——无需开发者重写应用程序。它分析传入的请求,并根据可配置的优先级(质量、延迟或成本)将请求路由到最合适的模型。
路由逻辑是可调的。一个需要在规划步骤上达到前沿模型准确度、但可以在执行层容忍更小模型的团队,可以配置 Switchyard 来反映这一点。一个纯粹优化成本的团队可以将更多流量推向 Lightning。路由器本身可以用不同的路由算法进行定制。
NVIDIA 在发布时公布的合作伙伴案例研究,让人们更具体地了解到这在实践中是什么样的:
这些不是理论预测——而是已经部署该系统的团队的生产环境实测数据。
这次发布一个更为实用的方面是定制化的易用性。由于 Lightning 是一个小模型,LoRA 微调既快速又经济。NVIDIA 还发布了 Nemotron-RL-Agentic-Terminal-Pivot,这是一个开源的 Agent 强化学习数据集,用于后训练 Lightning 的编码 Agent 能力——为团队提供领域特定适配的起点。
该模型可在多种硬件上运行,从 NVIDIA RTX 5090 或 DGX Spark 到完整数据中心部署。它托管在 Hugging Face、ModelScope、OpenRouter 上,也可作为 NVIDIA NIM 微服务在 build.nvidia.com 上获取。权重、训练数据和配方以 OpenMDW-1.1 许可证发布,允许商业使用和修改。
NeMo Switchyard 可在 GitHub 上获取,正在被集成到 Kong AI Gateway 和 LiteLLM 的代理层等合作伙伴平台中。
这次发布的实际意义在于,「用一个模型处理一切」的 Agent AI 方法在经济上越来越难以自圆其说。前沿模型与优化良好的执行模型之间的成本和延迟差距已经大到足以让路由变得值得——而相关的工具现已可用。
对于构建常驻型 Agent 的团队而言,这指向的架构是一个两层系统:一个用于规划和复杂推理的前沿模型,加上一个用于处理主导实际 token 消耗的高频工作的快速、可定制执行模型。Switchyard 使得这种劳动分工变得可编程,无需构建自定义路由层。
更广泛的趋势值得注意。随着 Agent 工作负载的成熟,瓶颈正从「模型能做到吗?」转向「我们能否在不导致成本失控的情况下规模化运行它?」Nemotron 3.5 Lightning 和 NeMo Switchyard 直接回答了这第二个问题。
这种特定组合是否会成为企业 Agent 的标准执行层,还有待观察。但它正在解决的问题——使高频 Agent 执行变得快速、准确和经济——是真实存在的,而且方法在技术上是合理的。