新一代数据中心不再单纯堆 GPU 算力,而是通过更智能的流量控制和网络优化提升整体效率。
在本周之前,关于 Nvidia 的主流叙事大致是这样的:在 AI 热潮的最初几年,Nvidia 是唯一能提供尖端 GPU 的厂商,随着行业规模化扩张,它赚得盆满钵满。过去几年间,亚马逊、Google 等超大规模云服务商开始自研芯片,Nvidia 不再是唯一的玩家,这让许多投资者质疑其优势的可持续性。
这个故事很有说服力,也基本属实。Nvidia 的市值在 2023 年初到 2025 年中期间增长了 10 倍,但过去一年其股价走势相对平缓,主要受到 GPU 竞争加剧的担忧拖累。
自周三 Nvidia 发布财报以来,一个新的叙事框架已经成形,投资者开始意识到 Nvidia 的优势远不止 GPU 本身。随着 AI 算力迈向千兆瓦级别,编排(orchestration)已成为一项日益复杂的任务。毫不意外的是,Nvidia 已经搭建了大量处理这些任务所需的尖端硬件,从而在 GPU 本身面临激烈竞争的同时,在围绕 GPU 的系统层面建立了巨大优势。
尽管业界一直在讨论算力商品化,但运营一座超大规模数据中心并使其达到峰值效率,依然是极其困难的事——而且随着部署规模越来越大、速度越来越快,这一挑战还在不断加剧。
从 Nvidia 实际销售的产品细节中,可以一窥其中的究竟。Nvidia 目前正在推出 Vera Rubin 架构,该架构将 Rubin GPU 与一系列其他组件结合在一起,包括 Vera CPU、Groq 3 LPX 推理加速器,以及用于存储和网络的类似机架。
过去一周,我一直在与 Nvidia 内部人士交流这些系统的实际功能,结果令人惊讶。与 Rubin GPU 本身一样,它们也是高度专业化的系统,只不过不是用来高速生成 token,而是确保 GPU 之外的一切都能高效运行。如果把 GPU 比作引擎,这些就是汽车的其余部分。
Vera CPU 尤其专注于数据编排问题。"Vera 很重要,因为无论在单一服务器还是任何类型的计算平台上,你能放置的内存都是有限的,"Nvidia 存储技术副总裁 Jason Hardy 告诉我。
随着数据中心算力规模的扩大,内存容量也在同步增长——这就是为什么美光(Micron)等公司在基础设施热潮的第二波中赚得丰厚利润的原因。但将数据在正确的时间送达 GPU 并非易事——当各家公司致力于将每瓦 token 数压得越来越低时,他们开始意识到这种流量调度的有多么关键。
"我们看到这些操作实现了高达 3 倍的提升,Vera CPU 实现了加速,"Hardy 表示。"因此我们现在能够将闪存发挥到最大潜力,因为我们可以从中释放全部性能,而不会成为瓶颈。"
Nvidia 之外也能看到类似问题的存在。OpenAI 在开发 Jalapeño 芯片时,一个主要焦点是通过最大限度地减少需要搬运的数据量来彻底规避这些挑战。
"我们设计 Jalapeño 的目标是最大限度地减少数据移动和通信延迟,"该公司在本月早些时候的一篇博客文章中表示。"它的大域(large domain)允许整个工作负载保留在一个互联系统内,最大程度减少数据移动,并帮助整个请求从始至终保持快速和高效。"
这是一种不同的思路——通过在一个集成芯片内完成工作负载来完全避免数据移动。但整体逻辑是相同的:通过更智能的流量调度来提高效率,而不是单纯增加处理器周期。这也因此打开了一个全新的基础设施竞争层。
对数据编排的这一新关注并不意味着 Nvidia 能自动获胜。在 GPU 领域面临的竞争一样,它也必须在芯片竞争对手和超大规模云服务商面前一争高下。但竞争已经转移到了一个新的层面,在那里打造一款竞品 GPU的重要性下降,能够让整个系统高效运作变得更为关键。
而至少在早期阶段,Nvidia 看起来已经占据了主导地位。