262K上下文窗口的稀疏MoE模型,免费下载但低价API背后绑定英伟达硬件生态,剖析开源模型作为GPU需求生成器的商业逻辑。
TL;DR — NVIDIA 的 Nemotron 3 Nano 30B(A3B)是一个稀疏的混合专家模型,上下文窗口为 262K,托管 API 定价为每百万 tokens $0.05/$0.20,并且以 BF16 格式免费开放下载。策略很简单:模型免费送,GPU 按需卖。测试结果显示,该模型在代码生成、算术推理和结构化信息提取任务上表现快速且准确——为高吞吐量 Agent 和微调基底奠定了坚实基础。
一家 GPU 公司刚刚以不到一分钱每百万 tokens 的价格向你提供了一个 300 亿参数模型。这件事应该让你觉得奇怪。但只要你记住 NVIDIA 实际卖的是什么——它卖的不是 tokens——这件事就不奇怪了。
NVIDIA 的利润并不来自推理 API 调用本身,而是来自这些调用底层的芯片。每发布一个开放权重模型——Nemotron 3 Nano 30B(A3B)就是这条产品线的最新成员——它本质上是一个伪装成科研发布的"需求生成工具"。便宜、好用的权重被下载、微调,然后部署在某人的硬件上。如果这些硬件恰好在 NVIDIA 自家技术栈(CUDA、TensorRT-LLM、NIM 容器)上运行效果最佳,那模型在权重本身还没产生一分收益之前就已经完成了它的使命。
托管 API 的定价也印证了这一点:每百万 prompt tokens $0.05,每百万 completion tokens $0.20,参见实时定价目录。这个价格即使对比同系列其他廉价开放模型也很有进攻性——符合一家追求量和影响力而非单 token 利润的厂商的定价策略。权重也同步发布在 Hugging Face 上,名称为 nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16,所以如果你想自己运行,完全不需要申请 API key。
Nemotron 是 NVIDIA 大语言模型产品线的家族名称;"Nano" 是为低延迟、低单 token 成本设计的级别,位于 NVIDIA 为更重负载保留的大型 Nemotron 变体之下。"A3B" 后缀与前几天在这个系列中看到的 Gemma 4 26B A4B 遵循相同的惯例:这是一种混合专家模型,其中总参数数量(30B)远大于每个 token 实际激活的参数数量(3B)。你得到了一个 30B 模型的能力,但推理成本接近 3B 模型——这就是为什么下面的吞吐量数字看起来如此漂亮。
另一个重要的元数据是上下文长度:262144 tokens,完整的 256K 窗口。这个长度足以容纳一个规模可观的代码库、一组长文档,或者一个大型 Agent 对话记录,而无需做分块处理。
三个快速任务,在托管端点上实时测试。
代码生成任务——写 merge_intervals 并说明其复杂度——模型给出了正确思路:按起始点排序,然后扫描合并,这是这道题的标注答案和标准模式。耗时 1.6 秒,速度 226.7 tokens/秒。
算术应用题——一个水箱以不同速率注水和排水,直到某个泵关闭——模型逐步计算净流量,最终得出正确答案:还需 20 分钟,耗时 1.4 秒,速度 306.8 tokens/秒。没有跳过步骤,没有算术失误。
结构化提取——从发票中提取供应商、日期和总额,以严格 JSON 格式输出——模型返回了一个干净、有效的 JSON 对象,包含恰好三个请求的键和正确的值,耗时 1 秒,速度 251.3 tokens/秒。
这些都不是什么难题——设计上它们就是那种占生产环境 90% 流量的"家常便饭"任务。值得注意的是三者的组合:正确的输出、2 秒以内的延迟,以及 200-300+ tokens/秒的吞吐量,同时模型定价仅为每百万 tokens 几分钱。这个组合才是 Nano 级别存在的全部意义。
这部分比任何基准图表都重要。三个用例是真正的绝佳匹配,还有一个常见用例则不太合适。
高吞吐量 Agent。 如果你运行的 Agent 循环每个任务要调用数十次工具,按规模算下来这笔账很残酷——token 费用快速叠加,延迟累积起来会把每秒turn数变成分钟数。有了 $0.05/$0.20 每百万 tokens 的定价,加上 200-300+ tokens/秒的吞吐量和 262K 上下文窗口,你可以负担得起让 Agent 把完整的对话历史、工具输出和中间推理过程都保留在上下文中,而不必时不时将其压缩掉。结构化输出测试干净通过在这里也至关重要——Agent 的生死取决于模型第一次能否返回可解析的 JSON。
本地部署助手。 因为权重以 BF16 格式公开发布,有数据驻留约束的企业——法律、医疗、国防相关——可以直接拉取这个检查点,在自有网络内运行,不会有任何 API 调用流出该网络。NVIDIA 自然希望这种部署发生在其自家 GPU 上,但模型本身并不强迫你这么做——选择权在你手里。
微调基底。 A3B 混合专家设计让你有 30B 的参数容量可供专精化,而每步微调成本更接近 3B 激活路径而非完整稠密模型。这与微调一个稠密 30B 模型的经济学轮廓有实质性不同,如果你想要一个有真实余量的领域专属助手而不是一个被压缩的 7B,这是一个好的起点。
不匹配的场景: 任何需要在真正困难、多跳问题上达到前沿推理深度的工作。这里的测试——区间合并、两阶段速率问题、单对象 JSON 提取——恰好是 Nano 级别模型设计用来又便宜又快搞定的任务。它们不能告诉你模型在对抗性推理链或长期规划任务上的表现如何,我也不会假装它们能。如果你工作在那个更难的领域,这是值得用自己的评测框架对比评估的候选,而非一个板上钉铃的结论。
NVIDIA 免费送出一个快速、廉价、256K 上下文窗口的 MoE 模型,这不是慈善——这是一个漏斗。但这个漏斗之所以有效,是因为处于其底部的模型在大多数生产系统真正需要的任务上确实能胜任:快速调用工具的 Agent、结构化提取、以及价格合理的微调基底。这三个测试都干净通过,定价确实低廉,权重确实开放。按这些标准评判,它赢得了这个位置。
明天的章节从模型转向在规模上真正负责调度其请求的引擎——vLLM。
写这篇文章之前,我今天通过托管 API 对 NVIDIA Nemotron 3 Nano 30B(A3B)跑了三个快速测试。样本量小,一个时间点的快照,路由到的硬件我无法控制——请将其视为嗅觉测试,而非基准测试:
Effective tokens/sec 包含了排队时间和首 token 时间——这是你实际体验到的速度,而非峰值解码速度。
模型卡:上下文窗口 262,144 tokens · 托管定价 $0.05/M 输入 · $0.2/M 输出 · 权重:Hugging Face 上的 nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16


NVIDIA——训练了 NVIDIA Nemotron 3 Nano 30B(A3B)并公开开放权重:nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16。正是因为这样的开放发布,这类系列文章才得以存在。
OpenRouter——用于本次实时测试的托管 API,以及定价和上下文数据。
量化和运行时维护者——那些大多数没有报酬的人,他们让每个开放发布在几天内就能在真实硬件上运行。