英伟达8月11日发布30B MoE大模型(3B活跃参数),内置Mamba-2/Transformer混合架构和NVFP4量化,结合开源训练配方;同期Qwen 27B即将48小时内登陆HuggingFace。
Nvidia 于 8 月 11 日发布了 Nemotron 3.5 Lightning,开源社区花了整整两天争论它——不是争论模型本身,而是 Nvidia 配套推出的路由系统。与此同时,Qwen 的 3.8-27B 将于两天后登陆 Hugging Face。以下是噪音之中的信号。
Nemotron 3.5 Lightning 是一个 30B 的混合专家模型(mixture-of-experts),实际激活参数 3B,设计定位是长期运行 agent 的执行层:承担推理模型触发但本身不执行的工具调用、结果验证和子 agent 交接。有三个细节值得关注:
Hybrid Mamba-2 / Transformer 架构。Nemotron 3 系列押注状态空间模型(State-Space Models,Mamba-2)作为骨干。HN 评论者指出这值得关注——SSM 正在"赶上常规 transformer 架构",一个旗舰级开放模型基于 SSM 本身就是该领域的一个重要数据点。
出厂即 NVFP4 量化。以 4-bit FP 格式发货,模型卡显示从 bf16 到 fp4 在 SWEBench 上出现巨大下降——这是关于量化代价的最清晰的公开测量数据之一。
全流程开源,不仅仅是权重。Nvidia 在 NeMo 仓库中发布了完整训练配方(数据 + 配方,权重除外)。正如一位评论者所说:"我不认为有另一个同等性能水平的模型能连同权重一起提供完全开源的数据和训练配方。"
HN 上的真实数据:M5 Max MacBook Pro(128GB)约 100 tok/s,64GB M1 Max 约 50 tok/s。反复被抱怨的问题:它会过度思考——推理链过长、反复质疑、有时输出很差。"它画了四张 SVG 才返回一只骑着自行车的不太像的鹈鹕。"
更有意思的争论围绕 NeMo Switchyard 展开——Nvidia 开源的路由库,旨在将每个请求路由到"最强大且最适合的模型"。HN 帖子(257 分)深入探讨了一个真实的矛盾:
路由器希望每次请求切换模型;prompt 缓存希望你停留在同一模型上。如果你已经在模型 A 上构建了 200k token 的上下文,而路由器把你弹到模型 B,你就失去了缓存,需要重新支付完整的 prefill 费用。
反驳观点:缓存黏性与路由质量之间的权衡是可调节的。一些路由器可以配置为选择中间方案——而且如果所有模型共享一个分布式缓存,切换的成本远低于人们假设的那样。
更深层的解读:大多数 agentic API 消费都发生在缓存读取(而非生成)中,任何破坏缓存的东西——包括"智能"路由——都可能悄无声息地让你的账单翻倍。这就是为什么几位评论者称路由器产品是"蛇油营销",也是为什么那些存活下来的产品会显式暴露缓存与路由的权衡。
Qwen 3.8-27B 将于 2 天后(8 月 15 日)开放权重。值得关注的背景:Qwen3.6-35B-A3B(27B 激活参数级别的 MoE)已经在与 Nemotron 的对比中表现得相当出色——"是的,它大约大 20%,但分数也大约高 20%,而激活参数相同",来自 HN 帖子。而 informed 评论者将 Qwen 3.8 Max 描述为"真的非常接近 Opus 4.8"。周五发布的 27B dense/open-weight 版本是本地开发最佳性价比争论中值得关注的那一个。
Nvidia 本周最重要的动作不是模型本身——而是模式:开放权重、开放训练配方、开放路由,全部定位为接入其硬件的入口。"让你的互补品 commodity 化"是帖子里投票最高的框架。无论你将其解读为慷慨还是护城河建设,结果都一样:开放权重生态系统刚刚获得了更多可信度,而本地/私有部署的论点每个发布周期都在变得更强。
AI Tools Pulse 是关于 AI 模型、工具及其相关争论的每日简报。