前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9275
  • 智谱GLM-5.3发布:开源编程能力最强模型
  • 智谱 GLM-5.3 编程能力最强开源模型发布,Qwen3.8-27B 同日开源
  • 英伟达量产全球首款 200G/lane 硅光交换机,功耗降为 1/5
  • 别分类,直接「幻觉」标签:LLM标签推荐新思路
  • Anthropic推出Claude文本水印检测API
  • RPA与工作流自动化深度对比:如何构建持久自动化
  • Google Sheets推AI画布,可用自然语言构建交互应用
  • n8n替代方案横评:企业级自托管AI自动化平台
  • 苹果AI策略区域分化或致iOS应用在中国行为不同
  • CoT Prompting 实战指南:何时用、怎么用
  • 阿里Qwen3.8:消费级硬件即可跑出Opus 4.6级性能
  • 什么是AI上下文架构?为什么不建议自建?
  • 阿里Qwen 3.8开源:27B参数上下文达26万token
  • OpenAI推出Computer History:Mac操作记录转为ChatGPT可搜索记忆
  • Grok 4.6 登陆 GitHub Copilot,专为 Agent 编码设计
  • 提升 Claude Code 使用效率的实战指南
  • 换用新模型前,先用历史失败用例回归测试
  • Qwen3.8-27B vs Qwen3.6-27B:架构完全相同,性能提升全赖训练
  • 编程Agent能读git log,却读不到你试错的四次失败
  • AI集成层大规模密钥泄露:Composio等平台暴露数千凭证
  • NVIDIA Nemotron 3.5 Lightning:解决Agent执行层成本与能力矛盾
  • 研究打脸:前沿模型还无法自主做科研
  • AI代理真正学会记住的四层记忆系统
  • Amazon Nova Forge 多轮强化学习奖励函数设计指南
  • GitHub推出覆盖全SDLC的Agent应用
  • AI by Hand:Hacker News热捧的AI辅助手工工具
  • SageMaker 联手 Bedrock AgentCore 构建多Agent工作流指南
  • 两阶段语义检索 + 结构化引用:游戏答案类 RAG 架构设计
  • 语音转文字 + 模型网关:知识库流水线的 API 设计实践
  • Meta发布Glimmer开源模型,Zuckerberg阐述开放AI理念
  • Google用同态加密让私有AI变为实用技术
  • Qwen3.8-27B 开源:家用显卡可跑,可商用
  • 大吞吐量 LLM 工单分类的成本控制五法
  • 阿里开源 OpenSandbox:AI Agent 安全沙箱,两天斩获 1.27 万星
  • AI 记忆不必是数据库:试试 Markdown + Git 方案
  • AI 功能开发中的信任边界设计原则
  • GLM-5.3编码能力跃升:基座未变,提升从何而来
  • AI 编程模型评测实战框架:从真实开发任务出发的选型方法
  • 阿里开源 Qwen3.8-27B:编程办公场景超越 Qwen3.7-Plus,推理资源可调控
  • AI生成的Shell命令需像MR一样审查
  • 中国医生用GPT-5.6-Sol 16小时证明22年数学难题
  • Qwen3.8-27B发布:阿里新一代开源大模型
  • Node.js API客户端防御式解析实战:四种结果分而治之
  • AGENTS.md成跨工具标准:Claude/Cursor/Codex统一配置指南
  • 一行属性将ASP.NET Core API暴露为MCP服务器
  • .NET消费MCP服务三动词:Connect/Discover/Call
  • .NET消费MCP服务:应用作为客户端
  • 生产级 AI Agent 可观测性建设实战指南
  • Kog深度优化GPU推理,挑战Agent工作流效率
  • 理想汽车自研云端推理芯片,数据流架构复用智驾设计
  • LLM分类器不必用真实类目:基于嵌入的假设分类法
  • 已加载 51 / 9275
8.0
热点
AI SCORE
模型发布2026-08-15 00:07

NVIDIA Nemotron 3.5 Lightning:解决Agent执行层成本与能力矛盾

dev.to · AI#NVIDIA#Agent#模型蒸馏
Editor brief · 编辑速览

NVIDIA发布轻量模型Nemotron 3.5 Lightning配合NeMo Switchyard,形成双模型组合方案——大模型负责规划、小模型处理高频工具调用,显著降本。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

当人们谈论 AI Agent 时,对话通常围绕规划模型展开——也就是那个负责推理、分解任务、决定下一步做什么的前沿系统。但在实际运行中,一个 Agent 的大部分 token 预算其实消耗在远不那么光鲜的事情上:工具调用、结果验证、格式转换、子 Agent 委托。这些重复性、高频次的步骤维持着工作流的运转,而它们根本不需要一个 5500 亿参数的模型来处理。

NVIDIA 于 8 月 11 日发布的 Nemotron 3.5 Lightning 和 NeMo Switchyard,正是为了解决这种错配而生的。它们共同构成了一个实际问题的两部分答案:如何构建既强大又经济实惠的常驻型 Agent?

The Execution Layer Problem

现代 Agent 系统越来越多地以「模型系统」的方式运作——即由不同模型处理工作流不同部分的集成系统。像 Nemotron 3 Ultra 或 GPT-5.6 这样的前沿推理模型可能负责编排复杂计划,但大量的实际工作——运行 git 命令、验证工具输出、回答计费问题、审查代码 diff——都是重复且定义明确的。

将所有这些执行流量都路由到前沿模型,代价高昂且速度缓慢。但如果路由到一个无法可靠遵循结构化指令或处理工具模式的模型,情况只会更糟。执行层需要一个快速、在约束任务上准确、并且成本低到可以大规模运行的模型。

这正是 Nemotron 3.5 Lightning 要填补的空白。

What Nemotron 3.5 Lightning Actually Is

Nemotron 3.5 Lightning 是一个 300 亿参数的混合专家(Mixture-of-Experts,MoE)模型,每个 token 仅激活 30 亿参数。MoE 架构意味着一个学习到的路由器将每个 token 发送到少数几个专门的「专家」子网络,使得模型以 3B 的计算成本获得 30B 模型的表示能力。

该模型内置了多项推理优化:

通过多 token 预测(MTP)实现的投机解码(Speculative decoding)。在预训练期间,模型被训练为同时预测多个 token,而不仅仅是下一个 token。这使得推理时能够进行投机解码:draft 模型提出若干个 token,主模型并行验证它们——显著提升吞吐量。NVIDIA 随 Lightning 一起发布了两个 draft 模型:DSpark(针对 DGX Spark 上的低并发工作负载优化)和 DFlash(更适合高并发场景)。

NVFP4 量化。模型同时提供 BF16 和 NVFP4 两种 checkpoint。NVFP4 使用 4 位浮点表示,配合专用内核,可运行在 NVIDIA Blackwell、Hopper 和 Ampere GPU 上,在大幅降低内存占用的同时实现近无损性能。

基于 Harness 优化的训练。模型针对流行的 Agent harness 进行了专门训练,如 OpenClaw 和 Hermes Agent,这意味着它被调优为输出这些框架期望的结构化结果——减少生产环境中的解析错误和重试循环。

根据 NVIDIA 的 PinchBench 基准测试,Lightning 在 Agent 任务上达到了 86% 的准确率,同时以与 Qwen3.6 35B 相当的准确度完成 10000 个任务,速度快 30%。在 Artificial Analysis Intelligence Index——即聚合了 Agent 任务、编码、科学推理和通用智能九项评估的综合指数——上,Lightning 处于其同级别模型的准确率-速度 Pareto 前沿。

NeMo Switchyard: Routing Work to the Right Model

拥有一个快速的执行模型只是问题的一半。另一半是在运行时决定哪些请求应该发给 Lightning、哪些应该发给前沿模型。这正是 NeMo Switchyard 所做的事情。

Switchyard 是一个开源模型路由库,可与现有 Agent 框架集成——LangChain、LiteLLM、Kong AI Gateway 等——无需开发者重写应用程序。它分析传入的请求,并根据可配置的优先级(质量、延迟或成本)将请求路由到最合适的模型。

路由逻辑是可调的。一个需要在规划步骤上达到前沿模型准确度、但可以在执行层容忍更小模型的团队,可以配置 Switchyard 来反映这一点。一个纯粹优化成本的团队可以将更多流量推向 Lightning。路由器本身可以用不同的路由算法进行定制。

NVIDIA 在发布时公布的合作伙伴案例研究,让人们更具体地了解到这在实践中是什么样的:

  • Ramp 使用 Switchyard 在其 SWE-Bench 变体上匹配前沿模型性能,同时将成本降低 58%、运行时间缩短 33%。
  • LangChain 在 145 个多轮 Deep Agents 任务中实现了 74% 的成本降低——仅将 7% 的调用路由到前沿模型,代价是 6% 的准确率权衡。
  • Cognition 将 Switchyard 集成到 Devin Desktop 中,在 FrontierCode Main 上实现了接近前沿的性能,同时将平均成本降低 28%。
  • Boomi 实现了 100% 的领域路由准确率,将 59% 的流量发送到速度快 5 倍的微调模型,将后续轮次的延迟降低 21%。

这些不是理论预测——而是已经部署该系统的团队的生产环境实测数据。

Customization and Deployment

这次发布一个更为实用的方面是定制化的易用性。由于 Lightning 是一个小模型,LoRA 微调既快速又经济。NVIDIA 还发布了 Nemotron-RL-Agentic-Terminal-Pivot,这是一个开源的 Agent 强化学习数据集,用于后训练 Lightning 的编码 Agent 能力——为团队提供领域特定适配的起点。

该模型可在多种硬件上运行,从 NVIDIA RTX 5090 或 DGX Spark 到完整数据中心部署。它托管在 Hugging Face、ModelScope、OpenRouter 上,也可作为 NVIDIA NIM 微服务在 build.nvidia.com 上获取。权重、训练数据和配方以 OpenMDW-1.1 许可证发布,允许商业使用和修改。

NeMo Switchyard 可在 GitHub 上获取,正在被集成到 Kong AI Gateway 和 LiteLLM 的代理层等合作伙伴平台中。

What This Means for Practitioners

这次发布的实际意义在于,「用一个模型处理一切」的 Agent AI 方法在经济上越来越难以自圆其说。前沿模型与优化良好的执行模型之间的成本和延迟差距已经大到足以让路由变得值得——而相关的工具现已可用。

对于构建常驻型 Agent 的团队而言,这指向的架构是一个两层系统:一个用于规划和复杂推理的前沿模型,加上一个用于处理主导实际 token 消耗的高频工作的快速、可定制执行模型。Switchyard 使得这种劳动分工变得可编程,无需构建自定义路由层。

更广泛的趋势值得注意。随着 Agent 工作负载的成熟,瓶颈正从「模型能做到吗?」转向「我们能否在不导致成本失控的情况下规模化运行它?」Nemotron 3.5 Lightning 和 NeMo Switchyard 直接回答了这第二个问题。

这种特定组合是否会成为企业 Agent 的标准执行层,还有待观察。但它正在解决的问题——使高频 Agent 执行变得快速、准确和经济——是真实存在的,而且方法在技术上是合理的。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
AI集成层大规模密钥泄露:Composio等平台暴露数千凭证
下一篇
研究打脸:前沿模型还无法自主做科研