NVIDIA 发布 Nemotron 3.5 Lightning,属于其 Nemotron 3 模型家族,主打长时 Agent 任务的高效率,适用于从聊天机器人向自主 Agent 迁移的场景。
随着 AI 从聊天机器人向自主 Agent 演进,开源模型正满足市场对 AI 运行位置、部署方式及进化路径的全面控制需求。
NVIDIA 今日宣布扩展 Nemotron 3 模型系列,推出 Nemotron 3.5 Lightning,这是同类产品中面向长时间运行 Agentic AI 工作负载的至高效率模型。此次发布紧跟 Nemotron 3 Nano 之后,体现了 NVIDIA 持续改进开源模型以实现更高准确性和速度的承诺。
Nemotron 3.5 Lightning 是一款拥有 300 亿参数的混合专家模型,专为大型多 Agent 系统内的专项任务而生,可助力构建更智能、更高效的 Agentic 应用。
此外,NVIDIA 还发布了 NeMo Switchyard,这是一个面向主流 Agent 工具的智能路由开源库。企业可用其基于自身特定需求构建路由器。部署后,NeMo Switchyard 能够智能地将每个请求引导至最胜任且最适合该任务的模型,无需开发者重写应用程序。
Nemotron 3.5 Lightning 与 NeMo Switchyard 协同工作,在 PC、工作站、数据中心和云端各类环境中,为 AI 的部署方式、运行位置及效率优化提供更强的掌控力。
Nemotron 3.5 Lightning 以一个小巧、可定制的开源模型提供前沿级智能,专为高吞吐量 Agentic 工作流打造。

现代 Agentic 系统——常驻 Agent——正日益作为模型系统或模型集成来运作,不同模型专精于不同任务。
NVIDIA Nemotron 开源模型即为这一架构而设计。前沿推理模型(如 Nemotron 3 Ultra 或 GPT-5.6)负责规划和编排工作流,而较小型的专精模型(如 Nemotron 3.5 Lightning)则执行定向任务,如代码审查、工具调用、安全告警监控和账单问题解答。
NVIDIA Nemotron 3.5 Lightning 是一款完全可定制的开源模型,专为驱动常驻 Agent 的高吞吐量任务而生。该模型由 Nemotron Coalition 贡献开发,成员单位提供了评估方法、推理软件和数据集,以推动模型进化。
该模型输出速度提升至 4 倍,使 Agentic 任务完成速度较同类模型快 30%。由于它是开源且可定制的,Nemotron 3.5 Lightning 可以使用 NVIDIA NeMo 基于组织自身的领域数据、工具和工作流进行后期训练,从而提升专项任务的准确性。
PinchBench 基准测试表明,Nemotron 3.5 Lightning 在保持前沿级准确性的同时,Agentic 任务完成速度优于同类模型。

各行业 AI 领军企业正在针对自身工作负载定制 Nemotron 3.5 Lightning:CrowdStrike 用于网络安全、Harvey 联合 Trajectory 用于法律服务、CodeRabbit 联合 Baseten 用于代码审查——均有效提升了领域专属 Agentic 任务的准确性。此外,Lila Sciences 正在帮助提升物理和生命科学领域的 Agentic 任务推理能力,Fastino Labs 定制该模型后在软件开发、金融和医疗工作负载上取得了领先准确性。
企业定制 Nemotron 3.5 Lightning,在 Agentic 工作流中的专精任务上达到了领先准确性。

Nemotron 3.5 Lightning 还让组织能够掌控隐私和部署。它可以在本地 AI 系统上运行——包括 NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 和 NVIDIA Jetson——帮助用户最大化现有基础设施投资,或在边缘 AI 设备、NVIDIA RTX PRO 工作站、数据中心和云环境中扩展企业用例。Nemotron 3.5 Lightning 还可在本地或私有环境运行,满足需要快速响应的高吞吐量专精任务。
此外,与每次 Nemotron 发布一样,NVIDIA 在许可范围内尽可能公开训练数据和技术,以便实现溯源、审计和其他模型的训练。除 Lightning 外,NVIDIA 还发布了 Nemotron-RL-Agentic-Terminal-Pivot,这是一个用于后期训练代码 Agent 能力的 Agentic 强化学习数据集。
有些模型更适合编码,有些更擅长推理,有些适合轻量任务,有些则针对本地运行以获得更高隐私和效率进行了优化。如果客户依赖单一默认模型,可能会过度支出或丧失质量;如果手动管理路由,则会变成拖慢部署速度的集成工作。
NVIDIA NeMo Switchyard 是一个面向 AI Agent 的开源模型路由库。该技术根据特定需求,将提示词自动路由至 Agent 工作流每一步最胜任且最高效的模型。Agent 应用开发者可以针对不同路由算法调优或修改路由器,以匹配其质量、延迟和成本优先级。在模型系统中,企业可以创建具有更优 Token 经济性的强大 AI Agent。
内部基准测试显示,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低至 Opus 4.8 单独使用的近三分之一。
NVIDIA 内部基准测试显示,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低至 Opus 4.8 单独使用的近三分之一。

NVIDIA 正与 AI 生态合作伙伴携手,将智能模型路由引入开发者已使用的工具和平台。
Nemotron 3.5 Lightning 已在 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com 上发布,亦可作为 NVIDIA NIM 微服务使用,并通过 NVIDIA 云合作伙伴、后期训练平台、推理平台和云服务提供商的广泛生态系统提供。NeMo Switchyard 可在 GitHub 获取,即将登陆合作伙伴平台。