NVIDIA发布新一代NVL72机柜,AI Agent任务耗电是普通聊天的15倍,该芯片通过架构优化显著提升能效比,为AI Agent大规模部署提供硬件基础。
根据 OpenRouter 数据,agentic AI 工作负载消耗的 token 数量是简单聊天请求的 15 倍。为什么?
思考一下 AI agent 在做投资决策时如何研究一家公司。agent 会查询金融数据库、搜索新闻和公告、调用 sub-agent 进行同行比较和模型估值,然后将所有信息综合成一份建议。Agent 和 sub-agent 持续进行推理直到任务完成,这推动了 token 需求的持续增长。每一步中,累积的 token 成为下一步的输入,使得长上下文处理成为 agentic AI 性能的核心。

从软件开发到客户服务再到深度研究,每个 agentic 使用场景都呈现着相同的模式。
随着 agentic AI 进入各行业的生产环境,运行它的基础设施需要高效地满足这种 token 需求。
新的实测性能数据显示,NVIDIA Vera Rubin NVL72 系统在 agentic 工作负载上每兆瓦的吞吐量比 NVIDIA GB300 NVL72 高出达 30 倍。NVIDIA 使用 SemiAnalysis AgentX 工作负载测量了这些推理吞吐量数据,该工作负载由记录的真实世界 agentic 编程会话组成,保留了实际的上下文增长、工具调用和 sub-agent 生成。对于功率受限的 AI 工厂,这意味着在相同的能源消耗下可以完成 30 倍的 agentic 工作。
Vera Rubin NVL72 的这些早期结果展示了 NVIDIA 加速创新的步伐。通过持续的software优化,Vera Rubin NVL72 和 GB300 NVL72 的性能都将持续提升。
Vera Rubin NVL72:每兆瓦吞吐量提升 30 倍,每百万 token 成本降低 35 倍
Agentic 工作负载与聊天或文档摘要有着本质区别,后者的输入和输出序列通常在 1K 到 8K token 之间。在 agentic 会话中,上下文在多个步骤中累积,可以达到数十万个输入 token,并且请求之间的输入和输出长度差异很大。性能测量必须演进,以捕捉完整的 agent 工作流,而不是单次推理请求。

以下结果反映了在真实世界 agentic 编程轨迹上测量的性能。
在 SemiAnalysis AgentX 中,NVIDIA Blackwell 平台在多个 agentic 模型上提供领先性能,包括 Kimi K3、MiniMax M3、GLM5.3、Qwen3.5 和 DeepSeek V4 Pro。
例如,GB300 NVL72 在 DeepSeek V4 Pro 模型上每兆瓦的吞吐量比 NVIDIA Hopper 架构高出达 15 倍,为客户提供了运行 agentic 工作负载的高性能基础。这一飞跃体现了更大规模的 scale-up GPU 域和协同设计 software 在提供显著更好推理效率方面的优势。
Vera Rubin 将这一优势扩展到整个 Pareto 曲线,在 DeepSeek V4 Pro 模型上提供比 GB300 NVL72 高达 30 倍的每兆瓦吞吐量。这些早期结果使用 SemiAnalysis AgentX 工作负载测量,目前正在等待 SemiAnalysis 审查,尚未反映 Vera CPU 在工具调用方面的性能。

NVIDIA DSX MaxLPS 技术在 GPU、机架和工作负载层面管理功率,在相同的兆瓦预算内配置多达 40% 更多的 GPU,在 AI 工厂规模上进一步提升每兆瓦吞吐量。
每兆瓦吞吐量也直接影响每个生成 token 的成本。Vera Rubin NVL72 的每百万 token 成本比 GB300 NVL72 低达 35 倍,可以跨客户工作负载的全面范围连续、规模化地运行 agent。

对于功率受限的 AI 工厂,每兆瓦吞吐量决定了 AI 工厂的收入,而每百万 token 成本决定了该收入的利润率。
面向 Agentic 规模的极致协同设计
现代推理优化涵盖一系列技术,对于 agentic AI 尤为关键。NVIDIA Vera Rubin NVL72 通过在平台每一层进行极致协同设计来实现所有这些技术及更多,从而提供多倍性能提升。
Disaggregated serving 将上下文处理(prefill)与响应生成(decode)分离,使两者能够独立扩展。
Rate matching 同步 prefill GPU 和 decode GPU 生成 token 的速度,以最大化效率。
大规模 expert parallelism 在 mixture-of-experts 模型中将 expert 子网络分布在 scale-up GPU 域上。
Distributed KV-caching 将内存扩展到 scale-up GPU 域,而 KV-cache offloading 将较不活跃的上下文分层到主机和存储,使先前处理的上下文保持可访问而无需重新计算。
KV-aware routing 将传入请求导向已经持有相关缓存上下文的 GPU,减少长会话中的冗余计算。
像 MegaMoE 这样的 fused CUDA kernel 将许多计算和 GPU 间通信操作合并为单一执行过程,使 GPU 保持活跃而不是等待数据。
NVIDIA Rubin GPU 增强的第五代 Tensor Core 和第三代 Transformer Engine 加速推理的 prefill 和 decode 两个阶段。NVFP4 量化将模型权重压缩到 4 位精度,减少内存占用并在不牺牲输出质量的情况下提高吞吐量。
NVL72 scale-up 域是 Vera Rubin 和 Grace Blackwell 的定义性架构,实现了大规模 expert parallelism 和 distributed KV-caching 等技术所需的高带宽低延迟 GPU 间通信。NVIDIA NVLink 互连技术和 NVLink Switches 专为驱动这个 scale-up 域而构建,现已发展到第六代,提供比现成以太网替代方案高 10 倍的数据包速率和低 3 倍的延迟。
从优化的 CUDA kernel 到 NVIDIA TensorRT LLM 等推理运行时以及 NVIDIA Dynamo 等 serving 框架,NVIDIA 的 software 栈与硬件协同设计以实现推理优化。
虽然上述结果反映了当前 Vera Rubin NVL72 的性能,但完整平台是七芯片架构,还包括 NVIDIA Vera CPU、Groq 3 LPU、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX 和 ConnectX-9 SuperNIC,全部专为规模化部署 agent 的 AI 工厂而构建。
极致协同设计也延伸到 NVIDIA 与合作伙伴的联合工程。Vera Rubin 已全面投产,并正在生态系统中扩展。
了解更多信息请访问 NVIDIA Vera Rubin 平台。