Google 第八代 TPU:为 Agent 时代设计
Google 发布新一代 TPU 芯片优化 AI Agent 应用,是重要行业动态,但对个人开发者直接影响有限。
Google 发布新一代 TPU 芯片优化 AI Agent 应用,是重要行业动态,但对个人开发者直接影响有限。
经过十年开发的巅峰之作,TPU 8t 和 TPU 8i 是为了以高效和规模驱动下一代超级计算而量身定制的。
首席技术官、AI 和基础设施负责人
Your browser does not support the audio element.
Google 正在推出第八代张量处理器单元,包含两款专用芯片:用于大规模模型训练的 TPU 8t 和用于高速推理的 TPU 8i。这些芯片是专门为处理 AI Agent 的复杂、迭代需求而设计的,同时在功耗效率和性能上实现了显著提升。您现在可以申请更多信息,为今年晚些时候的通用推出做好准备。
Google 新一代第八代 TPU(TPU 8t 和 8i)将推动 AI 的下一个时代。
TPU 8t 是一款训练强力芯片,旨在加速复杂的模型开发。
TPU 8i 专门用于低延迟推理,以支持快速、协作的 AI Agent。
两款芯片都使用定制硬件,相比之前提供更好的性能和能源效率。
这些新系统将在今年晚些时候上市,帮助您扩展 AI 工作负载。
Google 刚刚宣布了第八代定制 AI 芯片 TPU 8t 和 TPU 8i。这些芯片是为了处理大规模 AI 模型训练和运行复杂 AI Agent 所需的繁重工作而构建的。通过让每款芯片专注于训练或性能,Google 使 AI 更快、更能源高效。这款新硬件帮助开发者构建更智能的工具,能够更有效地进行推理和解决问题。
今天在 Google Cloud Next,我们推出了 Google 定制张量处理器单元(TPU)的第八代产品,即将推出两种不同的、为训练和推理而专门构建的架构:TPU 8t 和 TPU 8i。这两款芯片旨在为我们定制构建的超级计算机提供动力,驱动从前沿模型训练和 Agent 开发到海量推理工作负载的一切。多年来,TPU 一直在为包括 Gemini 在内的领先基础模型提供支持。这些第八代 TPU 将在训练、服务和 Agent 工作负载中共同提供规模、效率和功能。
在 AI Agent 时代,模型必须通过问题推理、执行多步骤工作流,并在持续循环中从自身行为中学习。这对基础设施提出了新的需求,TPU 8t 和 TPU 8i 是与 Google DeepMind 合作设计的,旨在承担最苛刻的 AI 工作负载,并适应不断演变的模型架构规模。
TPU 设定了多个 ML 超级计算组件的标准,包括定制数值、液体冷却、定制互连等等,我们的第八代 TPU 是超过十年开发的巅峰之作。原始 TPU 设计背后的关键洞察至今仍然成立:通过定制硅芯片并与硬件、网络和软件(包括模型架构和应用需求)协同设计,我们能够提供显著更高的功耗效率和绝对性能。
我们很高兴看到十年创新如何转化为真实世界的突破。如今,Citadel Securities 等先锋组织正在突破可能性的边界,选择 TPU 来驱动他们的前沿 AI 工作负载:
硬件开发周期远长于软件。随着每一代 TPU 的推出,我们需要考虑到硬件推向市场时将存在什么样的技术和需求。几年前,我们预测到随着前沿 AI 模型在生产环境中大规模部署,客户对推理的需求会上升。随着 AI Agent 的兴起,我们确定社区将受益于分别专门针对训练和服务需求的芯片。
TPU 8t 在大规模、计算密集型训练工作负载中表现出色,设计时具有更大的计算吞吐量和更多的扩展带宽。TPU 8i 设计时考虑了更多的内存带宽,用于服务对延迟最敏感的推理工作负载,这至关重要,因为 Agent 之间的交互在规模上会放大即使很小的低效。
重要的是,两款芯片都可以运行各种工作负载,但专业化能解锁显著的效率增益。
TPU 8t 旨在将前沿模型开发周期从数月缩短到数周。通过平衡最高可能的计算吞吐量、共享内存和芯片间带宽与最佳的功耗效率和高效计算时间,我们设计了一个系统,相比上一代在每个 pod 中交付近 3 倍的计算性能,实现更快的创新,确保我们的客户继续为行业设定步伐。
大规模能力: 单个 TPU 8t 超级 pod 现在可扩展到 9,600 个芯片和 2 PB 的共享高带宽内存,相比上一代具有两倍的芯片间带宽。这个架构交付 121 ExaFlops 的计算力,使最复杂的模型能够利用一个庞大的统一内存池。
最大利用率: 通过集成 10 倍更快的存储访问,结合 TPUDirect 直接将数据拉入 TPU,TPU 8t 有助于确保端到端系统的最大利用率。
接近线性扩展: 我们新的 Virgo Network,结合 JAX 和 Pathways 软件,意味着 TPU 8t 可在单个逻辑集群中为多达一百万个芯片提供接近线性的扩展。
除了原始性能外,TPU 8t 被设计为目标超过 97% 的"有效吞吐"——一个有用、高效计算时间的度量——通过全面的可靠性、可用性和可维护性(RAS)能力。这些包括遍布数万个芯片的实时遥测、自动检测和绕过故障 ICI 链接的重新路由而不中断任务,以及光学电路交换(OCS),可在无需人工干预的情况下围绕故障重新配置硬件。
每一次硬件故障、网络延迟或检查点重启都是集群未在训练的时间,在前沿训练规模下,每增加一个百分点都可能转化为数天的实际训练时间。
在 Agent 时代,用户期望能够提出问题、委派任务并获得成果。TPU 8i 被设计为处理许多专用 Agent 的复杂、协作、迭代工作,通常"蜂拥"聚集在复杂流程中为最具挑战性的任务提供解决方案和洞察。我们重新设计了堆栈,通过四项关键创新来消除"等待室"效应:
突破"内存墙": 为了防止处理器闲置,TPU 8i 将 288 GB 的高带宽内存与 384 MB 的片上 SRAM——比上一代多 3 倍——配对,使模型的活跃工作集完全驻留在芯片上。
Axion 驱动的效率: 我们让每个服务器的物理 CPU 主机翻倍,迁移到我们定制的 Axion Arm 架构 CPU。通过使用非均匀内存架构(NUMA)进行隔离,我们为完整系统优化了卓越的性能。
扩展 MoE 模型: 对于现代混合专家(MoE)模型,我们将互连(ICI)带宽翻倍至 19.2 Tb/s。我们的新 Boardfly 架构将最大网络直径减少了 50% 以上,确保系统作为一个内聚的、低延迟的单元工作。
消除延迟: 我们新的片上集合加速引擎(CAE)卸载全局操作,将片上延迟减少高达 5 倍,最小化延迟。
这些创新相比上一代提供 80% 更好的单位功率性能,使企业能够以相同成本服务近两倍的客户量。
TPU 8i 分层 Boardfly 拓扑从四个完全互连的芯片的构建块开始,扩展为八个板的完全互连组,其中 36 个这样的组完全互连为一个 TPU 8i pod
这第八代 TPU 也是我们协同设计理念的最新表现,其中每一项规格都是为了解决 AI 最大的难题而设计的。
Boardfly 拓扑是专为当今最有能力的推理模型的通信需求而设计的。
TPU 8i 的 SRAM 容量是针对生产规模推理模型的 KV 缓存占用而设定的。
Virgo Network 网络结构的带宽目标源自万亿参数训练的并行要求。
并且首次,两款芯片都在 Google 自有的 Axion ARM 架构 CPU 主机上运行,使我们能够优化完整系统,而不仅仅是芯片,以实现性能和效率。
两个平台都支持原生 JAX、MaxText、PyTorch、SGLang 和 vLLM——开发者已在使用的框架——并提供裸金属访问,为客户提供直接硬件访问而不需虚拟化的开销。开源贡献包括 MaxText 参考实现和强化学习用的 Tunix,为能力和生产部署之间提供了关键路径。
在当今的数据中心,功率而非仅仅芯片供应是制约因素。为了解决这个问题,我们在整个堆栈中优化了效率,采用集成功率管理,根据实时需求动态调整功耗。TPU 8t 和 TPU 8i 相比上一代 Ironwood 提供高达两倍的单位瓦特性能。
但 Google 的效率不仅仅是芯片级指标;它也是一个从硅到数据中心的系统级承诺。例如,我们在同一芯片上集成了网络连接和计算,显著降低了在 TPU pod 中移动数据的功耗成本。甚至我们的数据中心也是与我们的 TPU 协同设计的。我们在硬件和软件上进行了创新,使我们的数据中心能够比五年前每单位电力交付六倍的计算能力。
TPU 8t 和 TPU 8i 延续这一轨迹。两者都由我们第四代液体冷却技术支持,可维持空气冷却所无法达到的性能密度。通过拥有从 Axion 主机到加速器的完整堆栈,我们可以优化系统级能源效率,这在主机和芯片独立设计时是无法实现的。
Google Cloud 第四代冷却分配单元
每一个主要的计算转变都需要基础设施突破,Agent 时代也不例外。基础设施必须演变以满足自主 Agent 在推理、规划、执行和学习的持续循环中运行的需求。
TPU 8t 和 TPU 8i 是我们对这一挑战的回答:两个专用架构,旨在重新定义 AI 中的可能性,从构建最有能力的 AI 模型,到完美协调的 Agent 群,再到管理最复杂的推理任务。两款芯片将在今年晚些时候正式上市,可作为 Google 的 AI 超级计算机的一部分使用,该系统将专用硬件(计算、存储、网络)、开放软件(框架、推理引擎)和灵活消费(编排、集群管理和交付模式)整合为统一堆栈。
Agent 计算将重新定义可能性。我们很高兴宣布我们孜孜不倦创新的最新体现,以驱动这一转变,TPU 8i 和 8t。感兴趣的客户可以申请更多信息。