前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯4321
  • 模型量化原理解析:如何在不丢失智能的前提下压缩 LLMs
  • Meta 开源 Muse Glimmer:30B 参数可在笔记本本地运行
  • OpenAI 发布网络安全防御报告
  • Cursor vs Copilot 实测8个月:200k行TS仓库的选型结论
  • OpenAI CFO 分享 AI 原生财务团队建设经验
  • 我们做了一个AI前端生成器:截图/Prompt直接出UI代码
  • 长程AI Agent深度解析:/loop、/goal与Codex Goal Mode对比
  • Agent Memory工具横评:Mem0 vs Zep vs Letta vs Cognee vs LangMem v
  • GPU和AI服务器交易市场Stoa Markets上线
  • AWS SageMaker AI Spaces:EKS上跑托管IDE
  • Vibecoding走向成熟:单次生成进化为可持续生产系统
  • 我用Claude Code同时管15个项目的工作流设计
  • nOps 用 Bedrock AgentCore 将 FinOps Agent 上线周期缩短 75%
  • AI前端团队缺失的记忆层:设计系统作为组织级上下文
  • Claude Code 8 月 14 日起 Auto 模式变默认,模型路由和 MCP 生产化实战
  • NVIDIA开源Magpie TTS:低延迟多语言语音Agent方案
  • Meta 开源 Muse Glimmer 模型,开放权重定位个人超级智能
  • ABS:用 YAML 定义 AI Agent 行为规范,实现零 vendor lock-in 测试
  • AI投资系统:运行正常不等于决策正确
  • 统一Radix缓存:一棵树实现混合模型前缀复用
  • SGLang首发支持NVIDIA Nemotron 3.5 Lightning
  • Meta 发布可在普通 PC 本地运行的 Muse Glimmer,扎克伯格呼吁美国放宽开源 AI 限制
  • Kubernetes 部署 LLM 生产环境实战指南
  • 深度研究 Agent 架构:规划→搜索→验证→引用
  • 代码审查变快了,但资深工程师累倒了
  • MiniMax H3模型权重发布72小时内的生产部署复盘
  • 构建MCP服务器的安全教训:踩过的五个坑
  • 任务路由实践:让Claude Code按策略分配模型
  • 扎克伯格 6500 字 AI 宣言四大要点:开源、开放、与政策阻力
  • Meta发布30B开放权重Agent模型,单GPU可本地运行
  • 售后Agent防幻觉实战:intent路由+白名单数据彻底堵嘴
  • Meta Muse Code vs Fable 5:便宜但有代价
  • 扎克伯格:美若想开源 AI 领先,需减少数据使用和蒸馏的政策限制
  • 连锁药店AI电话助手因数百起投诉被迫下架
  • 别让AI干linter的活:确定性格式化问题应交给确定性工具
  • Vibe Coding第二周开始的问题:AI生成之后谁来维护
  • GPT-5.6 vs Claude Fable 5 vs Kimi K3:React Native AI 编程实测对比
  • 开发者实评 GPT-5.6 Sol:惊艳与过度工程的矛盾感受
  • GitHub Copilot 网页版新增对话历史快捷访问与最小化功能
  • 用TDD给AI套上缰绳:不会语言也能写测试
  • Docker Sandboxes:microVM隔离运行AI代码代理
  • Claude和GPT知识截止日期与训练时间线深度解析
  • 14000次Agent API调用分析:基础设施类工具占绝对主流
  • Contorium:为AI项目引入决策上下文记忆层
  • 技术栈崩塌:供应商锁定正在侵蚀AI应用
  • 静默失败检测框架:捕获"成功"却无输出的AI调用
  • AI系统读取外部网页的权限边界设计
  • 用Python构建AI驱动的SEO审计Agent
  • AI倒查百年论文:99.2%顶刊有问题
  • AI倒查百年论文:99.2%顶刊存在可疑问题
  • Agentic SDLC的全链路可观测性实践
  • 已加载 51 / 4321
8.0
热点
AI SCORE
工具产品2026-08-11 00:00

SGLang首发支持NVIDIA Nemotron 3.5 Lightning

LMSYS / SGLang Blog#SGLang#NVIDIA#LLM推理
Editor brief · 编辑速览

SGLang在发布首日即支持NVIDIA最新开源模型Nemotron 3.5 Lightning,支持本地、边缘和云端部署的常驻Agent场景。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

TL;DR: NVIDIA Nemotron 3.5 Lightning

Installation and Quick Start with SGLang

Optimized Inference with Speculative Decoding

Run Nemotron 3.5 Lightning with MTP

Run Nemotron 3.5 Lightning with DFlash

Run Nemotron 3.5 Lightning with DSpark

Control Reasoning for Each Agent Step

Optimizing inference for Nemotron 3.5 Lightning

Nemotron 3.5 Lightning offers Leading Accuracy and Efficiency for Specialized AI

SGLang 很高兴地宣布推出 NVIDIA Nemotron 3.5 Lightning 的 Day-0 支持——这是一款可定制的开源模型,旨在为本地系统、边缘、数据中心和云上的常驻型 Agent 提供动力。

常驻型 Agent 会收集上下文、进行推理、使用工具,并在多步骤工作流中自适应。前沿模型负责复杂的编排工作,而较小的模型则高效地处理高吞吐量的专业化任务。

Nemotron 3.5 Lightning 专为处理这些高吞吐量任务而设计。它从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并与 Nemotron Coalition 联合开发,在一款 300 亿参数的混合专家模型中结合了强大的编程、工具调用、指令遵循和多轮对话能力——每次仅激活 30 亿参数。

Nemotron 3.5 Lightning 可以驱动本地个人助理、自动化金融和风险工作流、支持网络安全调查、优化电信运营,以及改善零售体验。企业可以对其进行后训练,根据自身的特定术语、政策、工具和工作流进行定制。

借助 SGLang,开发者可以通过高性能、OpenAI 兼容的推理栈来服务该模型,并将其连接到 Agent 评测框架、本地助理和专业化企业工作流。

TL;DR: NVIDIA Nemotron 3.5 Lightning

Architecture: 混合专家架构

Model size: 300 亿总参数,30 亿活跃参数

Context length: 最长 100 万 token

Speculative Decoding: 多 token 预测、DFlash 和 DSpark

Modalities: 文本输入和文本输出

Training: 从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并在流行的 Agent 评测框架上训练

Customization: 基于开源数据集训练的开源模型,支持针对专业化工作流的后训练

Deployment targets: NVIDIA DGX Spark、DGX Station、RTX PRO、RTX、NVIDIA Jetson、H100、H200、A100、L40S、B200/GB200 和 B300/GB300

发布时可用性: BF16、NVFP4

Get started: 从 Hugging Face 下载模型权重:BF16 和 NVFP4

使用入门 cookbook 通过 SGLang 运行 Nemotron 3.5 Lightning

从 Hugging Face 下载模型权重:BF16 和 NVFP4

使用入门 cookbook 通过 SGLang 运行 Nemotron 3.5 Lightning

Installation and Quick Start with SGLang

SGLang 提供了高性能的服务运行时、连续批处理、前缀缓存、推测性解码和一个 OpenAI 兼容的 API。以下基线命令使用 BF16 检查点:

docker run --rm -it \
  --gpus all \
  --cap-add SYS_NICE \
  --ipc=host \
  --network=host \
  --entrypoint /bin/bash \
  lmsysorg/sglang:dev-nemotron3-5-lightning
sglang serve \
    --model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
    --mamba-backend flashinfer \
    --mamba-radix-cache-strategy extra_buffer \
    --reasoning-parser nemotron_3 \
    --tool-call-parser qwen3_coder

服务器启动后,使用任何 OpenAI 兼容的客户端发送请求:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:30000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Briefly explain: what is SGLang?"},
    ],
    temperature=1.0,
    top_p=0.95,
    max_tokens=1024,
)
choice = response.choices[0]
print("Reasoning:", choice.message.reasoning_content)
print("Content:", choice.message.content)

Optimized Inference with Speculative Decoding

Nemotron 3.5 Lightning 支持三种推测性解码技术——多 Token 预测(MTP)、DFlash 和 DSpark——可以在保持目标模型输出质量的同时加速 token 生成。

MTP 使用轻量级、模型集成的预测头来提议多个未来 token;DFlash 使用基于扩散的草稿模型来并行生成整个候选块;DSpark 则增加了置信度感知的半自回归草稿,在速度和 token 接受质量之间取得平衡。总体而言,它们让团队能够为其推理工作负载选择最佳的延迟、吞吐量和部署权衡。

对于低延迟服务,在 H100、H200 和 DGX Spark 上使用 DSpark;要获得最大吞吐量,我们推荐不使用推测性解码运行。

Run Nemotron 3.5 Lightning with MTP

Nemotron 3.5 Lightning 包含多 token 预测。SGLang 通过其推测性解码路径暴露 MTP,其中模型内置的预测头负责草拟未来 token,目标模型负责验证。

标准 SGLang MTP 接口使用 EAGLE 推测算法。具体每种硬件的命令请参见 cookbook。

Run Nemotron 3.5 Lightning with DFlash

DFlash 使用专用扩散草稿模型来提议一个线性 token 块,目标模型并行验证。在 SGLang 中,DFlash 需要兼容的草稿检查点,并与 MTP 分开启用。

SGLang 的 DFlash 实现不支持数据并行注意力,需要 pipeline parallel size 1。请参阅 SGLang 推测性解码指南以了解当前参数参考。

Run Nemotron 3.5 Lightning with DSpark

DSpark 是一种混合推测器,结合了自回归和并行扩散式草稿制作,介于 MTP 的完全自回归方法和 DFlash 的完全扩散方法之间,在 DGX Spark 上提供三者中最佳的性能。

Control Reasoning for Each Agent Step

Nemotron 3.5 Lightning 支持开启或关闭推理,允许路由器或 Agent 评测框架在困难步骤使用更深入的推理,在常规工作中直接给出答案。

推理默认开启。要请求不带推理痕迹的直接答案,请通过 chat_template_kwargs 传递 enable_thinking: false:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Classify this ticket: billing or technical?"}],
    extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)

对于启用推理的请求,请省略 chat_template_kwargs(推理默认开启)或显式设置:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Plan the steps to migrate this service."}],
    extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)

该模型还支持推理 token 预算。结合 enable_thinking 通过 custom_params 使用 thinking_budget 可以为每个请求改变推理深度和响应时间:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Debug why this build is failing."}],
    extra_body={
        "chat_template_kwargs": {"enable_thinking": True},
        "custom_params": {"thinking_budget": 512},
    },
)

推理控制在多模型系统中特别有用:编排器可以为规划、编程和模糊决策分配更大的预算,而在提取、分类和结构化转换时使用关闭推理模式或小预算。

Optimizing inference for Nemotron 3.5 Lightning

Nemotron 3.5 Lightning 在架构上与 Nemotron 3 完全相同,唯一的区别是权重和推测性解码栈,因此大部分性能工作落在了运行时本身。以下是我们向上游 SGLang 贡献的内容:

DSpark 集成。我们将 DSpark——一种结合自回归和扩散式草稿的混合推测器——接入 SGLang 和 Nemotron 模型定义,让你在 MTP 和 DFlash 之外多了三种推测器可供选择。

量化 DSpark 草稿头。将草稿头量化为 W4A16 可以减少其内存占用和每步延迟,而不会影响接受率,这在 DGX Spark 等内存受限的环境中尤为重要。

移除同步操作和异步调度。我们消除了草稿-验证循环中的 host-device 同步,并启用了异步调度,这样在当前批次仍在执行时可以准备下一个批次。

Nemotron 3.5 Lightning offers Leading Accuracy and Efficiency for Specialized AI

Nemotron 3.5 Lightning 结合了混合 MoE 架构——每次仅激活 300 亿参数中的 30 亿——与多 token 预测来减少计算量和加速生成。这些优化带来了比同类规模的开源模型高达 4 倍的吞吐量,帮助 Agent 更快速地完成专业化任务。

从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并在流行的 Agent 评测框架上训练,Nemotron 3.5 Lightning 将前沿级别的 Agent 能力迁移到一个紧凑、高效的模型中。它在 Agent 生产力、编程、工具使用、指令遵循和长上下文推理的基准测试中表现出色。

如图 1 所示,更高的推理吞吐量和 token 效率使 Nemotron 3.5 Lightning 处于效率前沿,帮助常驻型 Agent 更快速地完成高吞吐量工作。

Line chart comparing PinchBench accuracy with time to complete 10,000 tasks. Nemotron 3.5 Lightning reaches similar accuracy as Qwen3.6-35B roughly 30% faster and sits well ahead of Gemma 4 26B.

图 1:Nemotron 3.5 Lightning 以相当的准确率在比 Qwen3.6-35B 快约 30% 的时间内完成 Agent 任务,处于效率前沿。

NVIDIA Nemotron 3.5 Lightning 为本地系统、边缘、数据中心和云带来了快速、可定制的 Agent 智能。借助 SGLang Day-0 支持,开发者可以通过高性能、OpenAI 兼容的技术栈来服务该模型;控制每个 Agent 步骤的推理;为 DGX Spark 等本地部署管理内存;并通过多 token 预测、DFlash 或 DSpark 加速生成。

对于跨多个模型路由工作的系统,Nemotron 3.5 Lightning 为高吞吐量专业化任务提供了一个极具吸引力的选择,在这类任务中准确性、速度、开放性和部署控制都很重要。

从 Hugging Face 下载模型权重:BF16 和 NVFP4

使用 cookbook 通过 SGLang 运行 Nemotron 3.5 Lightning

通过订阅 NVIDIA 新闻并关注 LinkedIn、X、YouTube 上的 NVIDIA AI 以及 Discord 上的 Nemotron 频道来获取 NVIDIA Nemotron 的最新动态。

感谢所有为将 NVIDIA Nemotron 3.5 Lightning 引入 SGLang 做出贡献的人。

NVIDIA: Nirmal Kumar Juluru, Anusha Pant, Amir Klein, Faradawn Yang, Nave Assaf, Ryan Stewart, Alex Steiner, Bita Rouhani, Seong Hee Lee

What is new compared with the Nemotron 3 Nano?

Nemotron 3 Nano 确立了一种高效的混合 Mamba-Transformer MoE 设计,拥有 300 亿总参数、30 亿活跃参数、100 万 token 的上下文窗口和可控推理。Nemotron 3.5 Lightning 在三个方面在此基础上进行了重要升级:

前沿模型蒸馏:Nemotron 3.5 Lightning 从 Nemotron 3 Ultra 蒸馏而来,将 NVIDIA 前沿 Agent 模型的能力迁移到更小的部署规模中。

Agent 评测框架优化:Nemotron 3.5 Lightning 为流行的 Agent 评测框架和多轮工作流进行了训练,重点关注编程、工具使用、指令遵循和专业化任务完成。

推测性解码:Nemotron 3.5 Lightning 支持多 token 预测(MTP)、DFlash 和 DSpark,通过并行草稿和验证多个 token 来加速生成。

其结果是一个旨在用更少时间更准确地完成更多 Agent 任务的模型。

Original source

本文由 AI 翻译整理自 LMSYS / SGLang Blog,原文版权归原作者所有。

阅读英文原文
上一篇
统一Radix缓存:一棵树实现混合模型前缀复用
下一篇
Meta 发布可在普通 PC 本地运行的 Muse Glimmer,扎克伯格呼吁美国放宽开源 AI 限制