NVIDIA Nemotron 3.5 Lightning(30B MoE,激活 3B)在 SageMaker JumpStart 可用,Always-on Agent 场景吞吐量提升 4 倍,任务完成速度提升 30%。
NVIDIA Nemotron 3.5 Lightning 现已在 Amazon SageMaker JumpStart 中可用
NVIDIA Nemotron 3.5 Lightning 专为高容量 Agent 工作负载所需的快速、专业化模型执行而设计。通过 Amazon SageMaker JumpStart 上的 NVIDIA Nemotron 3.5 Lightning,你可以访问一款专为高容量 Agent 工作负载设计的开放模型。
此次发布后,你无需自行配置服务基础设施,即可从 Amazon SageMaker JumpStart 部署 Nemotron 3.5 Lightning。NVIDIA 将 Lightning 描述为同类中速度最快的开放模型,专为常驻型 Agent 提供动力。在高容量 Agent 工作负载上,它实现了高达 4 倍的吞吐量提升和高达 30% 的任务完成速度加速。该模型共有 30B 参数,但每次前向传播仅激活 3B 参数,可在单个支持的 GPU 上运行。因此,Agent 工作流中重复性的专业化步骤无需前沿级基础设施即可运行。在本文中,我们将展示如何从 SageMaker JumpStart 部署 Nemotron 3.5 Lightning。
Nemotron 3.5 Lightning 是一款公开发布的基础模型,蒸馏自 NVIDIA 的前沿模型 Nemotron 3 Ultra,并与 Nemotron Coalition 合作开发。它采用混合专家(Mixture-of-Experts,MoE)架构,专门针对流行 Agent 评测工具的 Agent 工具使用进行了训练。它在开放数据集上训练,并以开放模型发布,因此你可以自定义它、拥有结果权重,并将其部署到你的 Agent 运行环境中。
下表总结了 NVIDIA Nemotron 3.5 Lightning 的关键规格和性能特征。
常驻型 Agent 持续工作:它们收集上下文、观察环境、对已知信息进行推理,然后执行操作。许多这些步骤可能涉及模型调用,但它们并不都需要相同级别的能力。规划多阶段工作流或编排子 Agent 可能需要前沿级推理。而对警报进行分类、从表单中提取字段、或根据策略检查记录等工作,通常可以由更小、更专业的模型处理。这些任务可能占调用量的大部分。
在许多情况下,将所有模型支持的步骤都通过单个大型模型运行,可能会给那些更小、更专业的模型就能处理的工作增加前沿模型的成本和延迟。系统级模型方法可以改为将每个步骤路由到适合该任务的模型。
Nemotron 3.5 Lightning 专为该系统的高容量端而构建。其 MoE 架构在每次前向传播中激活 30B 参数中的 3B,有助于在长时间、多轮会话中保持高吞吐量。DFlash 推测性解码可进一步降低每个 token 的延迟。1M token 的上下文窗口允许 Agent 在长时间运行的会话中携带累积状态,而无需重复重新 grounding。
如果 NVIDIA NeMo Switchyard 是你技术栈的一部分,它可以跨你选择的模型池路由单个工作流步骤。Lightning 可被选用于高容量专业化步骤,在这些场景中其速度和领域特定的准确性非常适合。
在已发布的评估中,NVFP4 在许多任务上与 BF16 非常接近,如下表所示。NVIDIA 报告称,用于生成这些结果的评估配方和命令已在 NeMo Gym 中发布。准确性结果由 NVIDIA 在一致的评测工具下测量,可能与厂商自报告的数字不同。
下表比较了 Nemotron 3.5 Lightning 的 BF16 和 NVFP4 变体在关键推理和 Agent 基准测试上的表现。
组织可以使用 NVIDIA NeMo 对模型进行post-train,以适应特定领域的工具、工作流和策略,然后在他们选择的环境中部署生成的模型。此次发布的 SageMaker JumpStart 模型卡不提供 JumpStart 定制功能。
Lightning 专为 Agent 工作流内部的专业化、高频工作而构建:
你可以通过 Amazon SageMaker JumpStart 部署 Nemotron 3.5 Lightning,无需手动配置服务框架。
在开始之前,请确保你具备:
重要提示:部署此模型会创建一个 SageMaker AI 端点,运行时会产生费用。有关详细信息,请参阅 Amazon SageMaker AI 定价。完成使用后删除端点以避免持续产生费用。

图 1:在 SageMaker JumpStart 中搜索 Nemotron 3.5 Lightning
huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4。对于 BF16,请使用 huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-bf16。
图 2:SageMaker JumpStart 中的 Nemotron 3.5 Lightning 模型卡
图 3:Nemotron 3.5 Lightning 的模型卡详细信息

图 2:SageMaker JumpStart 中的 Nemotron 3.5 Lightning 模型卡
图 3:Nemotron 3.5 Lightning 的模型卡详细信息

图 4:为部署选择实例类型

图 5:端点状态显示 InService
你也可以从 Hugging Face 模型页面将 NVIDIA Nemotron 3.5 Lightning 部署到 Amazon SageMaker AI。在 Hugging Face 模型页面上,选择 Deploy,选择 Amazon SageMaker AI,然后选择 Deploy on SageMaker AI。这将打开 SageMaker AI 部署工作流,你可以在其中配置和部署模型。
图 6:从 Hugging Face 模型页面部署
通过 SageMaker JumpStart,你可以访问 NVFP4 和 BF16 变体。以下示例使用 NVFP4 模型 ID huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4。对于 BF16,请使用 huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-bf16。
from sagemaker.jumpstart.model import JumpStartModel
model_id = "huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4"
model_version = "*"
model = JumpStartModel(model_id=model_id, model_version=model_version)
predictor = model.deploy()
为避免不必要的费用,请在完成使用后删除 SageMaker AI 端点:
predictor.delete_endpoint()
NVIDIA Nemotron 3.5 Lightning 为 Amazon SageMaker JumpStart 带来了快速、专业化的 Agent 执行能力。NVIDIA 报告称,在高容量专业化工作上实现了高达 4 倍的吞吐量提升和高达 30% 的任务完成速度加速。其混合 MoE 架构、3B 激活参数、DFlash 推测性解码和 1M token 上下文专为高容量 Agent 工作流而设计。由于该模型是开放的且专为定制而设计,你可以针对你自己的工具和策略对其进行 post-train,并保留对生成模型的控制权。
Nemotron 3.5 Lightning 可以支持跨个人助手、金融服务、安全运营、电信和零售的专业化 Agent 工作负载。你今天就可以从 SageMaker JumpStart 部署它。
首先在 Amazon SageMaker JumpStart 中搜索 Nemotron 3.5 Lightning 开始使用。有关部署指南,请参阅 Amazon SageMaker AI 开发者指南中的 JumpStart 基础模型使用方法。