深入分析AI工厂经济性:每秒token数、每token瓦特数、单位成本、利用率与 uptime;阐述定制XPUs如何从整机视角而非单卡视角设计。
要在规模上生成智能,AI 工厂需要持续运行,其经济效益由实际产出定义:每秒 token 数、每瓦 token 数、每个 token 成本、利用率以及正常运行时间。
这要求 AI 基础设施按照完整工厂的方式设计建造,而非仅仅是一组独立加速器的集合。
超大规模云服务商和构建定制 XPUs 的 AI 原生公司,不仅需要考虑 XPU 设计,还需要考虑整个 AI 平台的设计与开发,包括纵向扩展和横向扩展网络、机架级架构、生产工厂软件以及成熟的供应商生态系统。
在 AI 工厂的规模下,这条路既复杂又昂贵,并且是从速将 XPU 推向市场的根本障碍。
打破这一制约意味着将定制 XPUs 与经过验证的成熟基础设施相结合——让构建者将创新聚焦于最关键的地方,同时利用已有的技术来处理其余部分。
NVLink Fusion 满足了这一需求,将 XPUs 与 NVIDIA 世界领先的 AI 基础设施连接起来,提升性能、加速上市时间并降低半定制 AI 工厂的风险。
对于运行万亿参数模型、混合专家架构以及 Agentic AI 等现代工作负载,如果纵向扩展 fabric 无法跟上,利用率就会下降,每个 token 的成本就会上升。
纵向扩展网络解决方案必须在三个维度上表现出色:
实际交付的性能:端到端网络性能、网络内计算以及成熟的软件集成。
工厂韧性:正常运行时间、持续健康监控与遥测,以及在工厂持续运行期间的组件级可服务性。
平台成熟度:通过使用成熟的技术栈降低运营风险,该技术栈在大规模部署和实现投资回报方面已有良好记录。
以 NVLink Fusion 为例,它将 XPUs 引入 NVIDIA NVLink 纵向扩展领域。第六代 NVLink 在 72-XPU 域内提供领先的高带宽、低延迟网络互联。XPU 到 XPU 传输的端到端延迟比基于现成以太网的替代方案低 3 倍,数据包速率则高 10 倍。
在端到端性能方面,NVIDIA GB300 NVL72 系统相比不使用 NVL72 的配置,能够提供显著更高的吞吐量和更好的交互性,未来的 NVLink 路线图配置包含多达 1,152 个加速器和共封装光学器件。
72-GPU NVLink 纵向扩展域使 GB300 NVL72 能够提供比 NVIDIA B300 更高的每 GPU 吞吐量和交互性。以下是 NVIDIA AI 推理性能基准页面的结果。

NVLink Fusion 还包含 NVIDIA NVLink-C2C,用于将 XPUs 连接到 NVIDIA Vera CPU 或其他生态系统的 CPU,提供比 PCIe 接口高 6 倍的能效——有助于消除 Agentic 系统中控制平面和计算平面之间的障碍。
开发定制 XPUs 的团队往往低估了将 XPU 创新转化为数据中心部署所需的工作量和复杂性。这包括:
理想平台应提供所有这些能力,让团队能够专注于有针对性的创新,同时使用经过验证的解决方案来处理其余部分。
NVLink Fusion 得到了一个专为快速开发、集成和部署而设计的生态系统支持,涵盖 ASIC 设计、CPU、IP 和光学互连合作伙伴。
"NVLink Fusion 让客户能够选择最满足其工作负载需求的 CPU 架构、性能级别和软件能力," Intel 数据中心硅工程副总裁兼总经理 Tim Wilson 表示。
NVLink Fusion 採用者还可以使用 NVIDIA MGX 机架级架构以及用于 MGX 认证系统(如 NVIDIA Vera Rubin NVL72)相同的供应链。制造合作伙伴负责设计和管理集成,而 MGX 供应商提供机架、散热、电源和新兴 800 VDC 设计的构建模块。
"通过 Vera Rubin [NVL72],我们在制造生产线上看到了近 100% 的系统构建自动化," QCT 和广达电脑产品与解决方案负责人罗介宇表示。"如果 XPU 采用 NVLink Fusion,这些投资的大部分都可以被利用。"
AI 工厂规划不会等待芯片就绪。电力采购、设施设计、散热、机架布局和网络架构在最终加速器组合确定之前就已开始。如果数据中心锁定于单一芯片,可能会带来进度风险。
不同工作负载可能偏好不同加速器,包括 XPUs、GPU、CPU 和 LPU。GPU 系统可以与半定制系统协同运行,用于训练、后训练、推理、检索和服务。
"NVLink Fusion 计划的价值在于……[客户] 可以使用 NVIDIA GPU 部署其机架级解决方案,然后可以将 XPU 开发解耦,按不同节奏进行," MediaTek 数据中心和计算业务集团企业高级副总裁兼总经理胡凯文表示。
NVLink Fusion 通过统一架构应对这些挑战。基于 XPU 和基于 GPU 的系统(如 Vera Rubin NVL72)可以共享机架占用空间、网络、散热、电源传输和管理系统。运营商可以先行推进构建,同时推迟精确的芯片组合,然后根据工作负载需求、芯片供应和业务优先级变化重新配置容量。
"NVLink Fusion 允许超大规模云服务商或定制 ASIC 设计商集成他们自己的定制 CPU 或 XPU,并将 NVIDIA 技术与第三方工艺连接起来,形成统一的机架级架构," GUC 董事长兼首席战略官庄立斯表示。
工厂建设成本高昂,错误可能需要付出昂贵的返工代价。基础设施建设必须在施工开始前完成验证。NVLink Fusion 与 NVIDIA DSX 参考架构(AI 工厂)保持一致:协同设计建筑、电力、散热、计算和网络。NVIDIA Omniverse DSX AI Factory Blueprint 为千兆瓦级 AI 工厂提供数字孪生和开放参考设计,使合作伙伴能够在部署前共同建模设施和技术。
在机架层面,可服务性是性能的一部分。参考计算托盘采用 100% 液冷,无风扇、电缆或软管,并允许在机架其余部分持续运行的情况下移除托盘。NVLink Switch 托盘同样采用液冷,并支持在维护期间持续运行。
"借助 NVLink Fusion,我们可以使用经过验证的 NVL72 机架设计来缩短上市时间,并且我们可以获得多个供应商的帮助,将更多产品交付到客户手中," Annapurna Labs(亚马逊旗下公司)高级硬件开发经理 CC Lee 表示。
软件使工厂完整。用于分布式工作负载的 NVIDIA NCCL、用于分解的 NVIDIA Dynamo 和 NIXL,以及用于集群管理、遥测和调试的 NVIDIA Mission Control,帮助运营商将混合 AI 基础设施作为协调系统运行。
借助 NVLink Fusion,XPUs 如今可以接入世界级的 AI 平台,使超大规模云服务商和 AI 原生公司能够构建统一的半定制 AI 工厂,将众多构建者的优势整合到任何一家公司都无法独立完成的基础设施中。
了解更多关于 NVLink Fusion 的信息。