Nvidia推出Nemotron 3.5 Lightning(30B MoE)和NeMo Switchyard开源路由库,前者稀疏激活适合持续Agent工作负载,后者可智能分发多模型请求。
Nvidia 刚刚扩展了 Nemotron 模型系列,发布了两款有望重塑多 Agent AI 系统构建方式的产品:Nemotron 3.5 Lightning,一款专为长时间运行的 Agent 工作负载设计的 300 亿参数混合专家模型;以及 NeMo Switchyard,一个用于在不同模型间智能调度请求的开源路由库。
从聊天机器人向自主 Agent 的转变,正在改变我们对 AI 模型的需求。聊天机器人处理的是一次性交互——一个问题,一个答案,完成。Agent 则持续运行,进行数十次工具调用,在长会话中保持上下文,并执行多步骤工作流。
Nemotron 3.5 Lightning 正是针对这一用例进行了专门优化。作为一款 300 亿参数的混合专家(MoE)模型,它在处理每个 token 时只激活部分参数,从而以比其实际规模小得多的模型的效率运行,同时保持了大模型的能力。核心特性包括:
这一点至关注重要,因为 Agent 的经济账非常残酷。为每个用户会话提供一次响应的聊天机器人很便宜。而一个进行 50 次工具调用的 Agent,每次调用都需要模型推理,成本会急剧攀升。一款针对长时间运行场景优化的模型,可能是 Agent 产品盈利与否的关键。
第二个发布产品 NeMo Switchyard 实际上可能是两者中更有趣的那个。它是一个智能模型路由的开源库,可与主流 Agent 框架集成。
Switchyard 要解决的问题:大多数 Agent 系统对所有任务使用单一模型,这很浪费。一次简单的工具调用不需要前沿模型,而复杂的推理步骤也不应该使用轻量模型。Switchyard 充当交通指挥员,根据任务需求将每个请求引导至最合适的模型。
这很重要,因为它实现了一种每个 Agent 系统都应该考虑的 cost-optimization 模式:使用能够处理每一步的最便宜的模型,只在需要时才升级到昂贵的模型。
这些发布是一个更广泛趋势的一部分:AI 基础设施正在针对特定工作负载类型进行专业化。"一个模型服务一切"的时代正在终结。取而代之的是:
对于构建 Agent 系统的开发者来说,这种专业化是好消息。它意味着你不再被困在每次推理调用都支付前沿模型价格的境地。有了智能路由和高效的专用模型,你可以构建具有可持续单位经济性的 Agent 产品。
如果你正在构建多 Agent 系统,NeMo Switchyard 值得立即评估——它所实现的路由模式是大多数 Agent 系统都应该实现的,无论使用哪个特定库。将简单任务路由到更便宜模型的 ROI 可以实现 5-10 倍的成本降低,同时对质量的影响微乎其微。
如果你正在处理长时间运行的 Agent 工作负载,Nemotron 3.5 Lightning 值得关注。MoE 架构非常适合持续推理,而且其开放性意味着你可以在适合自己基础设施的地方进行微调和部署。
两款产品现已可用,文档可在 Nvidia 的开发者门户查阅。
Based on Nvidia's announcement by Kari Briski, August 2026. Learn more at Nvidia's blog.