NVIDIA推出30B稀疏专家混合模型,激活参数仅3B,配套NeMo Switchyard模型路由器,针对Agent执行层优化,可动态路由到最便宜且能力足够的模型。
Artificial Intelligence
NVIDIA 发布了开放技术,用于从专业模型系统中构建常驻型 AI Agent。两个成果一并发布。Nemotron 3.5 Lightning 是一款轻量级、可定制的开放模型,专为高吞吐量 Agent 任务构建;NeMo Switchyard 则是一个开源路由库,负责将 Agent 工作流中的每一步导向当前最强大且最高效的模型。两者共同解决的是一个结构性问题:长时间运行的 Agent 大部分时间都花在工具调用、结果验证和子 Agent 委托上,而将每一步都发送到前沿推理模型会增加成本和延迟。Lightning 是一个 30B 的混合专家模型,包含 3B 活跃参数,基于混合 Mamba-2 + MoE + Attention 架构,上下文窗口达 1M token。NVIDIA 报告称其输出速度比同类规模的模型快最多 4 倍,在 10,000 个 PinchBench 任务上比 Qwen3.6 35B 准确率相当的情况下快 30%。CrowdStrike、Harvey、CodeRabbit、Fastino Labs 和 Lila Sciences 等多家行业厂商已在将其用于网络安全、法律、编程、金融和医疗工作负载的定制开发。
是的。Nemotron 3.5 Lightning 在宽松的 OpenMDW-1.1 许可证下全面可用,提供开放权重、训练数据和配方。NVIDIA 表示该模型已可投入商业使用。
哪些公司能用:任何拥有单块现代 GPU 的人。NVIDIA 列出了在单块 DGX Spark(GB10)或单块 H100 上的单 GPU 部署方式。这意味着独立开发者和种子轮初创公司享有与企业同等的起步条件。中型团队可以在 Baseten、Together AI 或 Nebius 上提供服务,受监管企业则可以完全本地化部署。
适用行业:NVIDIA 的具名客户群涵盖了网络安全、法律服务、软件开发、金融服务、医疗以及生命科学领域。
应用场景:工具调用、结果验证、子 Agent 委托、代码审查路由、日志分类、合同解析,以及在 1M token 上下文窗口内的长上下文检索。
长时间运行的 Agent 大部分时间都花在高吞吐量的执行任务上。工具调用、结果验证和子 Agent 委托主导了 token 消耗量。将每一步都路由到前沿推理模型会增加成本和延迟。
Nemotron 3.5 Lightning 瞄准的就是这个执行层。它是一个 30B 的混合专家模型,包含 3B 活跃参数,基于混合 Mamba-2 + MoE + Attention 架构。上下文长度达 1M token。预训练覆盖了超过 20 万亿个 token,使用了 NVFP4 配方。
该模型是 Nemotron 3 系列中最小的成员。Nemotron 3 Ultra 等前沿模型负责编排和规划,而 Lightning 则处理其下层的日常调用。
第一,投机解码(Speculative Decoding):多 token 预测在专门的预训练阶段就已内置,随后通过 MTP 提升阶段进一步优化。NVIDIA 还提供了两个外部草稿模型:DSpark,这是一个半自回归草稿模型,推荐用于 DGX Spark 和低并发数据中心工作负载;DFlash,则使用了轻量级块扩散模型。
第二,量化:NVFP4 检查点与 BF16 一并发布。同一个检查点可在 Blackwell 和 Hopper 原生运行,并通过 W4A16 内核扩展到 Ampere。
NVIDIA 报告称其输出速度比同类规模的模型快最多 4 倍。在 PinchBench 上,报告的准确率为 86%,同时在 10,000 个任务上比 Qwen3.6 35B 准确率相当的情况下快 30%。
已发布的模型卡结果(BF16 / NVFP4):MMLU Pro 81.94 / 81.62,GPQA Diamond 75.44 / 75.57,SWE-bench Verified 51.56 / 52.80,Terminal-Bench 2.1 24.58 / 23.46,AA-LCR 52.00 / 49.19。推荐采样参数为 temperature 1.0 和 top_p 0.95。
NeMo Switchyard 是一个开源库,将 Agent 工作流中的每一步路由到当前最强大且最高效的模型。
它提供无需调优的路由器,包括一个带有会话亲和性的 LLM 分类器、一个读取近期工具活动的阶段路由器,以及一个从低价起步并在持续高难度时升级的升级路由器。可调预填充路由器学习模型的残差流来预测哪个候选模型会成功。参考服务器接受 OpenAI、Anthropic 和 Responses API 请求。
两个已发布的结果:LangChain 对 145 个多轮 Agent 任务进行了基准测试。使用升级路由器在 Lightning 和 Claude Opus 4.8 之间路由,相比纯前沿模型基线降低成本 74%,将 7% 的调用发送到前沿模型,准确率约下降 6 个点。Cognition 在 Devin Desktop 中实现了分阶段路由。在 FrontierCode Main 上,在 Opus 5 和 Kimi K2.7 之间路由达到了 50.6% 的准确率,平均成本 3.11 美元,与 Opus 5 准确率相差 2.8 个点,平均成本降低约 28%。
30B 开放 MoE,3B 活跃参数,1M 上下文,OpenMDW-1.1 许可证,允许商业使用。
输出速度最快提升 4 倍;PinchBench 10,000 个任务比 Qwen3.6 35B 快 30% 完成。
速度来自多 token 预测加 DSpark 和 DFlash 草稿模型,以及 NVFP4 检查点。
可在单块 DGX Spark 或单块 H100 上运行,也可通过 Ollama、LM Studio、llama.cpp 和 Unsloth 本地运行。
NeMo Switchyard 在 LangChain 的 145 任务基准测试中降低成本 74%,准确率取舍约 6 个点。
可在 build.nvidia.com 或 OpenRouter 上试用,也可从 Hugging Face 或 ModelScope 下载权重。此外,欢迎关注我们的 Twitter,别忘了加入我们 15 万+的 ML SubReddit 并订阅我们的Newsletter。等一下!你用 Telegram 吗?现在你也可以加入我们了。
想与我们合作推广你的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等吗?欢迎联系我们
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以其对机器学习和深度学习新闻的深入报道而脱颖而出,内容既有技术深度又通俗易懂。该平台月浏览量超过 200 万次,彰显其在受众中的受欢迎程度。