TPU 等效于 NVIDIA NIXL 的推理优化库,解决预填充与解码实例间 KV Cache 传输和卸载问题,利好大规模推理部署。
Google 开源了 TPU Raiden,这是一款与 NVIDIA NIXL 等效的 KV Cache 传输库,标志着其 TPU 技术栈进一步向外开放。
据 @SemiAnalysis_ 报道,Google 开源了 TPU Raiden,这是一款用于 KV Cache 传输的推理优化库。该库对标 NVIDIA 的 NIXL 层,专注于 prefill-decode 实例通信和 Cache 卸载。
Google 开源了 TPU Raiden 推理库
Raiden 是 NVIDIA NIXL 的 TPU 等效实现
提供 prefill 和 decode 实例之间的 KV Cache 传输
包含 KV Cache 卸载的底层原语
来源:@SemiAnalysis_ 推文,暂无 Google 官方公告
Google 开源了 TPU Raiden,这是一款推理优化库,据 @SemiAnalysis_ 称,它是 NVIDIA NIXL 的 TPU 等效实现。该库提供 prefill 和 decode 实例之间的 KV Cache 传输,并包含用于 KV Cache 卸载操作的底层原语。这是 NVIDIA NIXL 的直接对应物——后者在多 GPU 推理流水线中处理类似的数据传输。
这一举措的时机值得关注。随着分离式推理(disaggregated inference)成为大模型的默认架构——prefill 和 decode 运行在不同的实例上以优化利用率——KV Cache 传输层成为一个关键的性能瓶颈。Google 决定将 Raiden 对外开放,表明它希望 TPU 开发者基于一个标准的、开放的接口来构建,而不是封闭的专有接口。这一模式在此前 Google 开源其 ML 技术栈的部分组件时就已有体现。
Raiden 的开源与其说是代码层面的事,不如说更多的是一种信号。Google 历来将其 TPU 软件栈与云服务紧密集成。通过发布 Raiden,Google 承认了推理优化层——也就是 NVIDIA 通过 NIXL 及其更广泛的 CUDA 生态变现的同一层——需要对外开放以吸引外部开发者。这是一个战略性转变:它使 TPU 成为推理工作负载中 NVIDIA 的更可信替代方案,特别是对于运行大规模分离式服务的团队。
对于工程师而言,实际影响是直接的。Raiden 的 KV Cache 卸载原语意味着基于 TPU 的服务现在可以处理更长的上下文和更大的批量,而无需让所有 Cache 都驻留在高带宽内存中。该库的存在也表明,Google 内部使用的 TPU 服务栈——用于 Gemini 和其他模型——已经成熟到公司愿意分享这套基础设施的程度。
NVIDIA 的 NIXL 是一个用于 GPU 内存和数据传输的低层库,设计用于跨其 Grace-Hopper 和 Blackwell 架构工作。Raiden 似乎针对类似的层级,但是 TPU 专用的。关键区别在于 NIXL 是 NVIDIA 更广泛的 CUDA 生态系统的一部分,这会将开发者锁定在其硬件上。如果 Raiden 是开放的且在精神上是硬件无关的,它可能为 Google 在 NVIDIA 当前主导的推理优化层中提供一个立足点。
值得注意的是,来源推文缺乏具体细节——没有基准数据、没有 API 细节、没有仓库链接。这一说法基于一条社交媒体帖子,Google 尚未做出官方声明。不过,模式是一贯的:Google 一直在稳步开源更多其 TPU 软件栈,包括其 XLA 编译器的一部分和模型服务基础设施。
Raiden 的开源是一个强烈的信号,但真正的考验是采用。关注主流推理框架——vLLM、TensorRT-LLM 或 Google 自有的服务栈——是否会在其下一个主要版本中集成 Raiden。同样关注 NVIDIA 的反应,特别是它是否会加大 NIXL 的专有功能投入,或开源更多自己的技术栈。如果 Raiden 获得 traction,它可能将推理优化的主导权从以 CUDA 为中心的模式转向更开放的多硬件模式。
Originally published on gentic.news