SGLang在发布首日即支持NVIDIA最新开源模型Nemotron 3.5 Lightning,支持本地、边缘和云端部署的常驻Agent场景。
TL;DR: NVIDIA Nemotron 3.5 Lightning
Installation and Quick Start with SGLang
Optimized Inference with Speculative Decoding
Run Nemotron 3.5 Lightning with MTP
Run Nemotron 3.5 Lightning with DFlash
Run Nemotron 3.5 Lightning with DSpark
Control Reasoning for Each Agent Step
Optimizing inference for Nemotron 3.5 Lightning
Nemotron 3.5 Lightning offers Leading Accuracy and Efficiency for Specialized AI
SGLang 很高兴地宣布推出 NVIDIA Nemotron 3.5 Lightning 的 Day-0 支持——这是一款可定制的开源模型,旨在为本地系统、边缘、数据中心和云上的常驻型 Agent 提供动力。
常驻型 Agent 会收集上下文、进行推理、使用工具,并在多步骤工作流中自适应。前沿模型负责复杂的编排工作,而较小的模型则高效地处理高吞吐量的专业化任务。
Nemotron 3.5 Lightning 专为处理这些高吞吐量任务而设计。它从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并与 Nemotron Coalition 联合开发,在一款 300 亿参数的混合专家模型中结合了强大的编程、工具调用、指令遵循和多轮对话能力——每次仅激活 30 亿参数。
Nemotron 3.5 Lightning 可以驱动本地个人助理、自动化金融和风险工作流、支持网络安全调查、优化电信运营,以及改善零售体验。企业可以对其进行后训练,根据自身的特定术语、政策、工具和工作流进行定制。
借助 SGLang,开发者可以通过高性能、OpenAI 兼容的推理栈来服务该模型,并将其连接到 Agent 评测框架、本地助理和专业化企业工作流。
TL;DR: NVIDIA Nemotron 3.5 Lightning
Architecture: 混合专家架构
Model size: 300 亿总参数,30 亿活跃参数
Context length: 最长 100 万 token
Speculative Decoding: 多 token 预测、DFlash 和 DSpark
Modalities: 文本输入和文本输出
Training: 从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并在流行的 Agent 评测框架上训练
Customization: 基于开源数据集训练的开源模型,支持针对专业化工作流的后训练
Deployment targets: NVIDIA DGX Spark、DGX Station、RTX PRO、RTX、NVIDIA Jetson、H100、H200、A100、L40S、B200/GB200 和 B300/GB300
发布时可用性: BF16、NVFP4
Get started: 从 Hugging Face 下载模型权重:BF16 和 NVFP4
使用入门 cookbook 通过 SGLang 运行 Nemotron 3.5 Lightning
从 Hugging Face 下载模型权重:BF16 和 NVFP4
使用入门 cookbook 通过 SGLang 运行 Nemotron 3.5 Lightning
Installation and Quick Start with SGLang
SGLang 提供了高性能的服务运行时、连续批处理、前缀缓存、推测性解码和一个 OpenAI 兼容的 API。以下基线命令使用 BF16 检查点:
docker run --rm -it \
--gpus all \
--cap-add SYS_NICE \
--ipc=host \
--network=host \
--entrypoint /bin/bash \
lmsysorg/sglang:dev-nemotron3-5-lightning
sglang serve \
--model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
--mamba-backend flashinfer \
--mamba-radix-cache-strategy extra_buffer \
--reasoning-parser nemotron_3 \
--tool-call-parser qwen3_coder
服务器启动后,使用任何 OpenAI 兼容的客户端发送请求:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:30000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Briefly explain: what is SGLang?"},
],
temperature=1.0,
top_p=0.95,
max_tokens=1024,
)
choice = response.choices[0]
print("Reasoning:", choice.message.reasoning_content)
print("Content:", choice.message.content)
Optimized Inference with Speculative Decoding
Nemotron 3.5 Lightning 支持三种推测性解码技术——多 Token 预测(MTP)、DFlash 和 DSpark——可以在保持目标模型输出质量的同时加速 token 生成。
MTP 使用轻量级、模型集成的预测头来提议多个未来 token;DFlash 使用基于扩散的草稿模型来并行生成整个候选块;DSpark 则增加了置信度感知的半自回归草稿,在速度和 token 接受质量之间取得平衡。总体而言,它们让团队能够为其推理工作负载选择最佳的延迟、吞吐量和部署权衡。
对于低延迟服务,在 H100、H200 和 DGX Spark 上使用 DSpark;要获得最大吞吐量,我们推荐不使用推测性解码运行。
Run Nemotron 3.5 Lightning with MTP
Nemotron 3.5 Lightning 包含多 token 预测。SGLang 通过其推测性解码路径暴露 MTP,其中模型内置的预测头负责草拟未来 token,目标模型负责验证。
标准 SGLang MTP 接口使用 EAGLE 推测算法。具体每种硬件的命令请参见 cookbook。
Run Nemotron 3.5 Lightning with DFlash
DFlash 使用专用扩散草稿模型来提议一个线性 token 块,目标模型并行验证。在 SGLang 中,DFlash 需要兼容的草稿检查点,并与 MTP 分开启用。
SGLang 的 DFlash 实现不支持数据并行注意力,需要 pipeline parallel size 1。请参阅 SGLang 推测性解码指南以了解当前参数参考。
Run Nemotron 3.5 Lightning with DSpark
DSpark 是一种混合推测器,结合了自回归和并行扩散式草稿制作,介于 MTP 的完全自回归方法和 DFlash 的完全扩散方法之间,在 DGX Spark 上提供三者中最佳的性能。
Control Reasoning for Each Agent Step
Nemotron 3.5 Lightning 支持开启或关闭推理,允许路由器或 Agent 评测框架在困难步骤使用更深入的推理,在常规工作中直接给出答案。
推理默认开启。要请求不带推理痕迹的直接答案,请通过 chat_template_kwargs 传递 enable_thinking: false:
response = client.chat.completions.create(
model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
messages=[{"role": "user", "content": "Classify this ticket: billing or technical?"}],
extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)
对于启用推理的请求,请省略 chat_template_kwargs(推理默认开启)或显式设置:
response = client.chat.completions.create(
model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
messages=[{"role": "user", "content": "Plan the steps to migrate this service."}],
extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)
该模型还支持推理 token 预算。结合 enable_thinking 通过 custom_params 使用 thinking_budget 可以为每个请求改变推理深度和响应时间:
response = client.chat.completions.create(
model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
messages=[{"role": "user", "content": "Debug why this build is failing."}],
extra_body={
"chat_template_kwargs": {"enable_thinking": True},
"custom_params": {"thinking_budget": 512},
},
)
推理控制在多模型系统中特别有用:编排器可以为规划、编程和模糊决策分配更大的预算,而在提取、分类和结构化转换时使用关闭推理模式或小预算。
Optimizing inference for Nemotron 3.5 Lightning
Nemotron 3.5 Lightning 在架构上与 Nemotron 3 完全相同,唯一的区别是权重和推测性解码栈,因此大部分性能工作落在了运行时本身。以下是我们向上游 SGLang 贡献的内容:
DSpark 集成。我们将 DSpark——一种结合自回归和扩散式草稿的混合推测器——接入 SGLang 和 Nemotron 模型定义,让你在 MTP 和 DFlash 之外多了三种推测器可供选择。
量化 DSpark 草稿头。将草稿头量化为 W4A16 可以减少其内存占用和每步延迟,而不会影响接受率,这在 DGX Spark 等内存受限的环境中尤为重要。
移除同步操作和异步调度。我们消除了草稿-验证循环中的 host-device 同步,并启用了异步调度,这样在当前批次仍在执行时可以准备下一个批次。
Nemotron 3.5 Lightning offers Leading Accuracy and Efficiency for Specialized AI
Nemotron 3.5 Lightning 结合了混合 MoE 架构——每次仅激活 300 亿参数中的 30 亿——与多 token 预测来减少计算量和加速生成。这些优化带来了比同类规模的开源模型高达 4 倍的吞吐量,帮助 Agent 更快速地完成专业化任务。
从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并在流行的 Agent 评测框架上训练,Nemotron 3.5 Lightning 将前沿级别的 Agent 能力迁移到一个紧凑、高效的模型中。它在 Agent 生产力、编程、工具使用、指令遵循和长上下文推理的基准测试中表现出色。
如图 1 所示,更高的推理吞吐量和 token 效率使 Nemotron 3.5 Lightning 处于效率前沿,帮助常驻型 Agent 更快速地完成高吞吐量工作。

图 1:Nemotron 3.5 Lightning 以相当的准确率在比 Qwen3.6-35B 快约 30% 的时间内完成 Agent 任务,处于效率前沿。
NVIDIA Nemotron 3.5 Lightning 为本地系统、边缘、数据中心和云带来了快速、可定制的 Agent 智能。借助 SGLang Day-0 支持,开发者可以通过高性能、OpenAI 兼容的技术栈来服务该模型;控制每个 Agent 步骤的推理;为 DGX Spark 等本地部署管理内存;并通过多 token 预测、DFlash 或 DSpark 加速生成。
对于跨多个模型路由工作的系统,Nemotron 3.5 Lightning 为高吞吐量专业化任务提供了一个极具吸引力的选择,在这类任务中准确性、速度、开放性和部署控制都很重要。
从 Hugging Face 下载模型权重:BF16 和 NVFP4
使用 cookbook 通过 SGLang 运行 Nemotron 3.5 Lightning
通过订阅 NVIDIA 新闻并关注 LinkedIn、X、YouTube 上的 NVIDIA AI 以及 Discord 上的 Nemotron 频道来获取 NVIDIA Nemotron 的最新动态。
感谢所有为将 NVIDIA Nemotron 3.5 Lightning 引入 SGLang 做出贡献的人。
NVIDIA: Nirmal Kumar Juluru, Anusha Pant, Amir Klein, Faradawn Yang, Nave Assaf, Ryan Stewart, Alex Steiner, Bita Rouhani, Seong Hee Lee
What is new compared with the Nemotron 3 Nano?
Nemotron 3 Nano 确立了一种高效的混合 Mamba-Transformer MoE 设计,拥有 300 亿总参数、30 亿活跃参数、100 万 token 的上下文窗口和可控推理。Nemotron 3.5 Lightning 在三个方面在此基础上进行了重要升级:
前沿模型蒸馏:Nemotron 3.5 Lightning 从 Nemotron 3 Ultra 蒸馏而来,将 NVIDIA 前沿 Agent 模型的能力迁移到更小的部署规模中。
Agent 评测框架优化:Nemotron 3.5 Lightning 为流行的 Agent 评测框架和多轮工作流进行了训练,重点关注编程、工具使用、指令遵循和专业化任务完成。
推测性解码:Nemotron 3.5 Lightning 支持多 token 预测(MTP)、DFlash 和 DSpark,通过并行草稿和验证多个 token 来加速生成。
其结果是一个旨在用更少时间更准确地完成更多 Agent 任务的模型。