NVIDIA 发布 Nemotron 3.5 Lightning(30 参数 MoE,推理速度比同类快 4 倍)和开源路由库 Switchyard,支持从边缘设备到云端的多硬件部署,可审计、可微调,适合隐私敏感型 Agent 工作流。
Agentic AI 系统——即那些能够自主编排多个模型以完成复杂任务的系统——正在成为现代生产力工具的支柱,从代码审查助手到网络安全监控莫不如此。NVIDIA 最新推出的 Nemotron 3.5 Lightning 和 NeMo Switchyard 解决了这一领域的两个关键痛点:效率和可控性。通过提供一个仅 30 个参数的 mixture-of-experts 模型(速度比同类产品快四倍),并提供一个开源路由库(能够动态为每个子任务选择最合适的模型),NVIDIA 让开发者能够在从边缘设备到云集群的各种硬件上运行高吞吐量、隐私敏感的工作负载,同时不牺牲性能。
这一影响远超原始速度。两个模型和路由库的开源特性意味着组织可以审计、微调和扩展系统以满足特定领域的需求。这种透明度在模型溯源和合规性必须强制执行的受监管行业中尤为宝贵。此外,能够部署在 NVIDIA RTX PC、DGX Spark、DGX Station、Jetson 和 RTX PRO 工作站上,确保了同样的高质量 Agentic AI 可以在本地和云环境中使用——这是混合云战略日益增长的灵活性需求。
Nemotron 3.5 Lightning 是一个 300 亿参数的 mixture-of-experts(MoE)模型,建立在前辈 Nemotron 3 Nano 和 Nemotron 3 Ultra 的基础之上。其架构专为高吞吐量专业化任务量身定制,如代码审查、工具集成、安全监控和账单查询。主要技术亮点包括:
MoE 分层:模型采用稀疏激活机制,将每个 token 路由到专家子集,在保持表达力的同时降低计算开销。
训练透明性:NVIDIA 公开了所使用的数据集和训练技术,使审计人员能够验证合规性和可追溯性。
强化学习兼容性:Nemotron-RL-Agentic-Terminal-Pivot 数据集支持 agentic 强化学习的训后微调,使模型能够从真实世界交互中学习。
性能基准:在 Pinch Bench 套件上,Nemotron 3.5 Lightning 达到了前沿级准确率,同时完成 agentic 任务的速度比同类模型快 30%。
部署十分简便。该模型以 NVIDIA NIM 微服务的形式在 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com 上提供,并可通过 NVIDIA 的 NeMo 框架集成到现有推理流水线中。对于需要本地部署的组织,该模型可以在 RTX PC、DGX Spark、DGX Station、Jetson 和 RTX PRO 工作站上运行,为敏感工作负载提供隐私保护解决方案。
如果说 Nemotron 3.5 Lightning 提供了原始算力,那么 NeMo Switchyard 解决的则是当单个模型无法覆盖 agentic 工作流所有环节时出现的编排问题。Switchyard 是一个开源库,将提示词路由到每个步骤最强大或最高效的模型,无需手动选择模型或重写应用。
🔹 --------- • Description: -------------
🔹 动态路由 • Description:提示词根据一组标准(质量、延迟、成本)进行评估,并被路由到最优模型。
🔹 可定制算法 • Description:开发者可以调整路由逻辑以优先考虑不同指标。
🔹 零栈变更 • Description:Switchyard 可以作为插件集成,无需修改现有代码库。
🔹 成本效益 • Description:内部基准测试显示,任务完成成本降至单独使用 Opus 4.8 的约三分之一。
这些结果展示了 Switchyard 在各领域的通用性——从企业集成平台到 AI 驱动的开发工具。
NVIDIA 的生态战略在其广泛合作伙伴对 Nemotron 3.5 Lightning 和 Switchyard 的利用中可见一斑:
CrowdStrike:部署该模型执行网络安全 agentic 任务,受益于高吞吐量、低延迟推理。
Harvey with Trajectory:将该模型用于法律服务,领域特定的微调至关重要。