SGLang 与 Google Cloud 合作,为 TPU 提供原生支持和完整功能。开发者可在 Google 硬件上灵活部署 LLM 推理工作负载。
RadixArk 与 Google Cloud 携手合作,为 TPU 带来 SGLang,让开发者能够灵活选择在任何硬件上运行工作负载。
SGLang 是一个开源推理框架,专为生产环保下的高吞吐和低延迟而构建。凭借超过 30,000 个 GitHub star 和 1,700 多名贡献者,它在全球数百万 GPU 上运行,每天在生产环境中生成数万亿个 token。RadixArk 是 SGLang 项目的维护者。
当前,开发者可以通过 SGL-JAX 在最新一代 TPU 上运行 SGLang,支持包括 Gemma、Qwen、DeepSeek、GLM、Mimo、Kimi、Ling、MiniMax 和 Grok 在内的主流大语言模型和多模态模型族,以及用于视频和图像生成的 Wan 和 Flux 等扩散模型。今年晚些时候,RadixArk 将推出 SGL-torchtpu,这是一个额外的 PyTorch 原生 TPU 后端,具有 eager execution、PyTorch 生态兼容性和 MPMD 支持。它将让业界任何 AI 研究员或工程师使用标准 PyTorch 工具在 Google TPU 上运行 LLM,同时实现高性能、可扩展性和最先进的特性。这些特性包括在多主机 TPU 上以完整尺寸运行领先开源模型,质量与已发布的基准匹配,以及并行化(数据、张量、专家、上下文和流水线)、Radix Cache、HiCache、量化和推测解码——由 RadixArk、Google 和 SGLang 社区开发的 TPU Pallas 内核提供支持。
展望未来,SGLang 将使新开源模型能够在与 GPU 相同的第一天就在 TPU 上运行,这种 Day 0 支持将扩展到每一代新 TPU。
这些能力使 TPU 成为经济高效的前沿推理选择。团队可以使用他们在 GPU 上使用的相同 SGLang API 和特性,同时拥有根据工作负载需求和性价比选择硬件的自由。
"RadixArk 的使命是让前沿 AI 基础设施对每个开发者开放和易于获取。SGLang 体现了这一点,我们很高兴能与 Google Cloud 合作,将其性能和灵活性带到 TPU 生态系统中,"RadixArk 首席执行官 Ying Sheng 表示。
"要真正加速前沿 AI 创新,开发者必须拥有自由选择和使用具有更好性能、可靠性、可扩展性和成本效益的 AI 训练和推理平台的权力,"Google 核心 ML/AI 工程副总裁 Bill Jia 表示。"我们与 RadixArk 的合作是实现'可编程异构性'愿景的关键一步,其中软件充当开放桥梁而非锁定机制。通过将 SGLang 的高吞吐推理框架引入 Google TPU,我们实际上消除了开发者的'迁移成本',使他们能够使用完全相同的 SGLang 推理 API 跨越硬件选择(如 GPU、TPU)和 AI 框架(如 PyTorch、JAX)无缝运行生产工作负载。"
SGL-JAX 是 RadixArk 和 SGLang 社区的联合成果,现已在 github.com/sgl-project/sglang-jax 提供。
SGL 系列始终欢迎新的贡献者帮助我们共同构建一个开放、高性能的推理引擎!