仅 36 亿参数的稀疏模型在 Intelligence Index 上与 GPT-4o 持平,吞吐量达 670 tokens/s,展示小参数模型在效率上的竞争力。
Nvidia 的新模型 Nemotron 3.5 Lightning 是一款紧凑的开源权重模型,在智能基准测试中与 OpenAI 的 gpt-oss-120b 得分相当,但参数量仅为其四分之一,同时提供了同类别中最快的推理速度。
Nvidia 发布了 Nemotron 3.5 Lightning,这是其全新 Nemotron 3.5 系列的首款模型。该模型直接接替了 Nemotron 3 Nano 30B A3B,并延续了其混合 Mamba-Transformer 架构,拥有 316 亿总参数,但在任何给定时间仅激活 36 亿。
根据独立基准测试平台 Artificial Analysis 的数据,该模型在 Intelligence Index 上得分为 24,比前身(15)提升了 9 点。这使 Lightning 与 OpenAI 的 gpt-oss-120b(24)处于同一水平,略微落后于 Nvidia 自家的 Nemotron 3 Super(26,后者参数量约为前者的四倍)。同尺寸类别中最聪明的小模型,如 Qwen3.6 35B A3B(32)和 Meta 的新 Muse Glimmer(35),仍然保持着明显的领先优势。
Nemotron 3.5 Lightning 在 Artificial Analysis Intelligence Index 上得分为 24,与 gpt-oss-120b 持平。| 图片:Artificial Analysis

Nvidia 瞄准了效率前沿的不同位置。在使用最终 NVFP4 权重的预发布测试中,模型达到了近 670 tokens/秒的吞吐量,在所有对比模型中测量到的吞吐量最高,几乎是 Google Gemini 3.5 Flash-Lite(386 tokens/秒)的两倍。Intelligence Index 中的一项任务大约需要 0.5 分钟完成,而 Qwen3.6 35B A3B 需要约 3.5 分钟,Gemma 4 31B 需要约 5.8 分钟。
Lightning 以 669 tokens/秒成为对比中最快的模型。尽管每项任务生成的 token 数量与前身 Nemotron 3 Nano 相近,但交付了更好的结果。| 图片:Artificial Analysis

专有模型仍然主导着整体效率前沿。Gemini 3.5 Flash-Lite 在 Intelligence Index 上得分为 37,每项任务耗时相近,而 GPT-5.6 Luna (max) 在不到两分钟内达到 52 分。
代理基准测试中改进最为显著
根据 Artificial Analysis 的数据,最大的改进出现在代理基准测试中。在 GDPval-AA v2 上,Lightning 达到了 824 的 Elo 评分,比 Nemotron 3 Nano 提升了 334 点。这超越了 gpt-oss-120b(800)和更大的 Nemotron 3 Super(698)。在 Terminal-Bench v2.1 上,得分从 7 跃升至 24.3%,几乎与 gpt-oss-120b 的 26.2% 持平。
在代理基准测试中,Lightning 以 824 的 Elo 评分超越了 gpt-oss-120b 和更大的 Nemotron 3 Super。| 图片:Artificial Analysis

Nvidia 以宽松的 OpenMDW-1.1 许可证发布该模型,将其定位为基于代理流程的高吞吐量工作引擎。Artificial Analysis 报告称,Nvidia 与 CodeRabbit 和 Harvey 等合作伙伴在后期训练上合作,以提升特定领域的性能。
Nvidia 提供 BF16 和 NVFP4 两种权重版本的模型。根据 Artificial Analysis 的数据,NVFP4 变体在 Intelligence Index 上也得分为 24,与更高精度版本相比质量损失极小。该推理模型仅处理文本,支持 100 万 token 的上下文窗口。权重现已可用,无服务器推理由 DeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius 和 Crusoe 等提供商提供。
Nvidia 追求效率而非规模并非新策略。去年其研究人员发表了一篇引发广泛讨论的论文,认为参数量低于 100 亿的模型可以像 700 亿至 1750 亿参数模型一样处理大多数代理工作负载,成本仅为后者的十分之一到三十分之一。Nemotron 3.5 Lightning 拥有 316 亿参数,但每步仅激活 36 亿,处于同一轻量级类别。它以近 670 tokens/秒的速度在代理基准测试中超越了 gpt-oss-120b 和更大的 Nemotron 3 Super,成为该论点最清晰的产品级验证。
THE DECODER 精选的无炒作 AI 新闻
订阅 THE DECODER,享受无广告阅读、每周 AI 时事通讯、六次/年专属「AI Radar」前沿报告、完整档案访问及评论区域。