NVIDIA 将 Groq 3 LPX 纳入 Vera Rubin NVL72 机架系统,专为 Agent 工作负载优化高速 token 生成。研究重点在于芯片、网络、系统三层协同设计,而非单一突破。
AI 推理的下一时代不会由单颗突破性芯片、网络或系统来定义,而是由 AI 工厂每一层如何协同工作来决定。这也是 NVIDIA 正在扩展 Vera Rubin NVL72 以面向 Agent 系统提供快速 Token 生成能力的原因。
NVIDIA 今日宣布,NVIDIA Vera Rubin rack-scale 系统 NVIDIA Groq 3 LPX 已全面投产。在 Artificial Analysis 基准测试中,针对开源 Agent 模型 Gemma 4 31B,它在处理 100,000 Token 长上下文这一对 Agent 系统至关重要的场景下达成了 3,400 output tokens per second 的成绩,比最接近的替代平台快 4 倍。
全球行业合作伙伴正在采用 Vera Rubin 平台解决方案。SpaceXAI 宣布 NVIDIA Vera CPU 将为其下一代 Agentic AI 提供算力支撑。CoreWeave 已投入生产部署 Spectrum-X Multiplane,该网络通过多个并行交换机连接 NVIDIA Vera Rubin 机架,提供高带宽、平坦且无损的 AI 网络。Nebius 是首家采用 NVIDIA Groq 3 LPX 的 AI 云。
随着 AI 从训练转向推理和 Agentic,推理已成为新的前沿。Agentic AI 系统正在生成更多 Token、处理更大得多的上下文窗口,并日益与其他 AI 系统协作以解决复杂问题。
这些工作负载需要一类新的基础设施,不仅要针对性能优化,还要以前所未有的规模实现吞吐量、响应速度和经济效益的平衡。
在加州帕洛阿尔托举行的 Hot Chips 大会本周活动上,NVIDIA 正在展示极限协同设计(extreme codesign)如何从端到端重塑 AI 工厂。通过将计算、网络和推理加速架构化为统一系统,NVIDIA 正在帮助客户构建专为长上下文推理和多 Agent 系统的新兴需求打造的基础设施。
Extreme codesign 是 NVIDIA 平台的指导原则。Vera Rubin 经过工程优化,以加速 Agent 在越来越长序列上的推理。
NVIDIA Spectrum-X Ethernet 高效地移动这些海量数据流,使其穿过 AI 工厂,而 NVIDIA Groq 3 LPX 则以极快的速度生成 Token。它们共同展示了 NVIDIA 如何优化 AI 管道的每个阶段——从上下文和通信到生成——作为单一集成 AI 工厂架构的一部分。
NVIDIA Groq 3 LPX 带来了新的低延迟推理架构,旨在与最通用的 AI 工厂平台 Vera Rubin NLV72 协同工作,帮助企业和云服务商提供 Agent 应用所需的高吞吐量和可扩展经济效益。
突破性的性能不是来自孤立优化单个组件,而是来自对堆栈每一层进行协同设计。从网络和上下文处理到大规模推理,NVIDIA 的全栈平台将 AI 工厂转化为智能集成引擎,旨在将日益增长的 Token 量转化为收入。
Nebius 作为领先的 AI 云,率先采用 NVIDIA Groq 3 LPX,让开发者能够以前所未有的响应速度访问领先的 Token 生成能力,用于高度响应性的 Agentic AI 应用。
在 Nebius Token Factory 中将 NVIDIA Groq 3 LPX 添加到 NVIDIA Vera Rubin NVL72,将提升推理性能,使开发者能够大规模构建高度交互式 Agent、编码系统和其他实时 AI 体验。
CoreWeave 通过部署 Spectrum-X Multiplane 连接 NVIDIA Vera Rubin 机架,解锁其 AI 云基础设施的进步。
SpaceXAI 计划围绕 NVIDIA Vera Rubin 构建和扩展其未来 AI 架构,从地球数据中心到轨道卫星。该公司计划部署 NVIDIA Vera CPU 来加速 Agentic AI 背后的 CPU 密集型工作,包括编排、工具调用、代码执行、数据处理和仿真。

SpaceXAI 与 NVIDIA 的合作将 NVIDIA 全栈 AI 平台扩展到 SpaceXAI,整合 Vera CPU、NVIDIA 加速计算、网络和软件,以前所未有的规模推进 AI。
Vera Rubin 为 Agentic 时代设计,提供业界领先的单核性能、卓越的内存带宽以及负载下可预测的性能,帮助 Agent 更快速地完成任务,并保持宝贵的 GPU 基础设施充分利用。
与 Vera Rubin NVL72 平台协同设计的 NVIDIA Groq 3 LPX 正在帮助 AI 工厂以最低延迟为 Agentic 工作负载提供 Token。
Agentic AI 正在创造一个新的性能挑战:解码延迟。当 AI Agent 推理、使用工具并与其他系统交互时,它们逐个 Token 地生成响应,导致即使微小的延迟也会在复杂工作链中倍增。为保持 Agent 以用户期望的速度运行,NVIDIA Groq 3 LPX 通过专门的 Token 生成加速扩展了 Vera Rubin NVL72 平台。
NVIDIA Rubin GPU 处理大规模上下文处理,而 LPX 加速对延迟敏感的解码工作负载。其结果是更快、更可预测的 Token 生成,帮助 AI 工厂提供响应式推理、更流畅的 Agent 交互和更高的基础设施效率。

Rubin GPU 和 LPU 共同设计,旨在消除传统上速度与吞吐量之间的权衡,帮助 AI 提供商为下一代 Agentic AI 应用提供响应式、大规模推理。
随着行业从模型训练转向大规模服务智能,基础设施必须演进成 NVIDIA 所描述的"Token 工厂",能够同时实现性能、吞吐量、智能完整性和经济效益。Agentic AI 系统日益与其他 AI 系统通信、访问多个数据源并维护大量上下文,对快速推理产生了前所未有的需求。
NVIDIA Groq 3 LPX 正是为这些工作负载设计的。作为 Vera Rubin NVL72 的扩展,它即使在海量上下文窗口上也能实现超快速响应,同时帮助服务商最大化吞吐量和基础设施利用率。
与独立加速器不同,NVIDIA Groq 3 LPX 通过极限协同设计结合了 GPU 和 LPU 的优势。Rubin GPU 和 LPU 共同计算 AI 模型的每一层,为 Agentic 工作负载实现推理性能的新水平。
在大规模部署中,LPU 集群作为针对确定性推理优化的大型处理器运行。一个机架规模的 NVIDIA Groq 3 LPX 部署可包含 256 个 LP30 加速器,通过芯片直连链路连接,打造为现代 AI 工厂构建的高效推理引擎。
随着推理模型的增长和 Agentic 工作流生成越来越多的 Token,为它们提供服务的基础设施必须不断演进。NVIDIA Groq 3 LPX 扩展了 Vera Rubin NVL72 平台,配备了专为最大化响应速度、吞吐量和效率而设计的推理架构,为下一代 AI 工厂提供动力。
而这只是开始——与 Vera Rubin NVL72 搭配,将有更多优化、更多模型、更多性能——更高吞吐量和交互性的新水平即将到来。敬请期待。
随着 AI 工厂规模急剧扩大,网络已成为性能的关键引擎。在 Hot Chips 上,NVIDIA 重点展示 Spectrum-X Multiplane——这是硬件加速 Spectrum-X Ethernet 架构的最新演进,使 Ethernet 能够扩展到前所未有的规模,同时避免添加另一网络层级所带来的延迟、抖动和成本。

NVIDIA Spectrum-X Ethernet 被设计为端到端、AI 优化的 Ethernet 平台,结合了 NVIDIA Spectrum-X Ethernet 交换机、SuperNIC 和软件,以提升基于 Ethernet 的 AI 基础设施在 AI 工厂和云中的性能和效率。该平台旨在提供比现成 Ethernet 高 1.6 倍的 AI 网络性能,同时在多租户环境中提供一致、可预测的性能。
将 AI 工厂扩展到超越当今最大集群的传统方式意味着添加第三网络层级,这会引入延迟、不可预测地拖慢速度,并大幅增加线缆、光学和电力成本。Spectrum-X Multiplane 采用更简单的方法:它将每台服务器的 网络连接拆分为多个独立路径,或称"平面"(plane),每个平面运行自己的轻量两级网络。其结果是一个平坦、简单的网络,可扩展至 512,000 个 GPU,而无需第三层级的额外成本和复杂性。
这一切都是自动完成的。NVIDIA ConnectX SuperNIC 内部的专用硬件引擎管理跨平面的流量,并即时重新路由绕过任何故障,因此应用程序和软件只需看到一个快速、可靠的连接。在八平面拓扑中,如果一个平面发生故障,网络仍能保持约 90% 的总带宽,硬件恢复速度比软件多平面负载均衡快 11 倍。这意味着 AI 工厂输出提高 1.6 倍。
这种可靠性来自 Vera Rubin NVL72 的极限协同设计,涵盖交换机芯片、SuperNIC 和软件。Spectrum-X SN6000 系列交换机基于 102.4Tb/s Spectrum-6 Ethernet ASIC 和 ConnectX-9 SuperNIC,支持每个 GPU 最高 1,600Gb/s,专为 Vera Rubin NVL72 AI 工厂打造。Spectrum-XGS Ethernet 将同样的协同设计扩展到数据中心,让多个设施作为一个 AI 超级工厂运行,将多站点 NCCL 集合加速 1.9 倍。
NVIDIA 推出 NVIDIA Scale-In,这是 NVIDIA AI 网络的第五根支柱,也是一类面向 Agentic AI 工厂的新型加速网络基础设施。Scale-In 将专用加速扩展到保护、管理和运营 AI 工厂的基础设施服务。

NVIDIA Scale-In 由 NVIDIA BlueField-4 处理器和 NVIDIA DOCA 软件平台提供动力,通过 NVIDIA Spectrum-X Ethernet 连接,将传统南北向访问网络转型为统一、加速的基础设施域。
云计算为数据中心带来了软件定义网络、可组合性和弹性,使用户、应用程序、数据和服务能够动态扩展。
Agentic AI 代表了下一平台转变。AI 工厂将大规模加速计算与日俱增的用户、应用程序和自主 Agent 汇聚在一起,所有这些持续与数据、存储和服务交互。这改变了为 AI 带来生命力的基础设施需求。现在,网络、存储、网络安全和运营必须与 AI 计算一同加速,将软件定义的灵活性与专用硬件加速和全栈协同设计相结合。
NVIDIA Scale-In 提供多租户网络、高性能存储访问、芯片内安全、弹性供给和实时可观测性,同时保持基础设施处理独立于主机计算资源。通过作为 AI 工厂的一部分来加速和协同设计这些服务,Scale-In 帮助安全、数据访问和运营与 AI 计算一同扩展。其结果是安全、高效、可管理的共享基础设施,用于在超大规模下部署和运营 Agentic AI。
NVIDIA NVLink Fusion 将定制硅芯片引入 NVIDIA 全球领先的 AI 基础设施平台,使超大规模云和 AI 原生公司能够以更高性能、灵活性和速度构建半定制 AI 工厂。
随着 AI 模型的规模和复杂性增长,单纯依靠原始算力已远远不够。AI 工厂需要高带宽、低延迟的纵向扩展网络、成熟的机架级架构,以及涵盖电源、冷却、管理软件和供应链的完整生态系统。NVLink Fusion 通过将定制 XPU 和 CPU 连接到 NVIDIA 的纵向扩展和横向扩展技术栈来解决这些挑战。
该平台包括第六代 NVIDIA NVLink 和专为纵向扩展网络打造的 NVLink Switch,以及用于 XPU 和 CPU 之间高能效连接的 NVLink-C2C。通过 NVIDIA MGX 生态系统,采用者还可以使用经过生产验证的机架设计、组件、制造合作伙伴解决方案,以及用于分布式计算、分解式工作负载和集群管理的开放式可扩展软件。
通过在统一架构上标准化 GPU 和 XPU 系统,NVLink Fusion 有助于将数据中心建设与硅芯片就绪状态解耦。运营商可以共享机架空间、网络、冷却、电源传输和管理系统,然后根据供应和工作负载需求的变化调整 GPU 和 XPU 的组合。
NVLink Fusion 扩展了 NVIDIA AI 平台垂直整合、水平开放的定制硅方法。它让合作伙伴在他们差异化的地方自由创新,同时利用 NVIDIA 跨计算、网络、基础设施和软件的技术——打造一个没有任何单一公司能够独立构建的单一、灵活 AI 工厂。