OpenAI 与 Broadcom 合作定制 ASIC 芯片 Jalapeño,9 个月内完成,AI 参与代码重写,专注推理阶段的低延迟与高吞吐。
当 OpenAI 在六月发布 Jalapeño(其首款定制推理芯片)时,公司做出了一些重大承诺。这款与博通(Broadcom)合作、从零开始为大型语言模型推理打造的芯片,OpenAI 表示早期测试显示其每瓦性能显著优于现有加速器。不过当时 OpenAI 并未公布支持这一说法的详细性能数据。
周二,OpenAI 发布了 Jalapeño 在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 上的首批实际运行结果。结果显示出 OpenAI 为 Jalapeño 制定的目标:在不产生更长响应时间的前提下实现更高吞吐量。
"代理需要按顺序完成多个步骤,因此延迟会贯穿整个任务并不断累积。"
代理在执行任务时可能反复调用模型,利用工具并根据结果决定下一步操作,这意味着在单次推理中几乎察觉不到的延迟,在执行较长任务的反复过程中会变得非常明显。
"代理需要按顺序完成多个步骤,因此延迟会贯穿整个任务并不断累积,"OpenAI 表示。
Jalapeño 的设计正是针对这些延迟问题。运行大型语言模型的不同阶段对硬件有不同需求:初始提示词(prompt)需要更多计算资源,而响应生成则对内存带宽施加更大压力。每当数据需要在核心和芯片之间传输时,都会产生额外等待时间。
Jalapeño 采用了不同方案,在不牺牲某一环节性能的前提下减少等待时间。
"代理需要按顺序完成多个步骤,因此延迟会贯穿整个任务并不断累积,"OpenAI 表示。
这有助于解释 OpenAI 在 Jalapeño 上做出的一些设计选择。运行大型语言模型在不同阶段对硬件的需求各不相同:处理初始提示词需要大量计算资源,而逐 token 生成响应则更依赖内存带宽。每当数据需要在核心和芯片之间移动时,也会造成时间损失,导致系统各部分等待所需数据。
其理念是减少这种等待,同时不牺牲某一环节的性能。模型状态(包括生成响应时使用的 KV 缓存)可以保留在本地,而 Jalapeño 的网络能力允许更多工作负载保持在同一互联系统内。这意味着当工作负载在计算和内存之间切换时,花在数据迁移上的时间更少。
OpenAI 通过 InferenceX(SemiAnalysis 的公开 AI 推理基准测试)对 Jalapeño 进行了测试,使用的模型包括 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。在这三个模型上,Jalapeño 每瓦处理的工作量是原来的 1.5 到 1.9 倍,同时将端到端延迟缩短了 1.7 到 3.6 倍。在高交互性工作负载上,OpenAI 表示其速度比对比系统快了 2.1 到 4.1 倍。
在 Previous best time-between-tokens 工作点下进行比较时,差异尤为显著。OpenAI 报告称,每瓦工作量提升了 8.6 到 104.3 倍(因模型而异)。
OpenAI 基于各加速器公布的功耗评级进行能效比较。Jalapeño 的额定功耗为 700 瓦,但公司表示在这些测试中从未超过 550 瓦。更重要的是,OpenAI 并不打算以牺牲响应时间为代价来提升吞吐量——而这通常是推理场景中的权衡取舍。
批处理更多工作负载可以提高基础设施效率,但也可能导致单个用户等待时间更长。OpenAI 对 Jalapeño 的论点是,推理系统越来越需要在两方面都表现出色——尤其是在公司持续降低 API 访问成本的同时,还需要保持交互式工作负载的响应性。
更重要的一点是,OpenAI 并不打算以牺牲响应时间为代价来提升吞吐量——而这通常是推理场景中的权衡取舍。
OpenAI 在 Jalapeño 开发过程中全程使用了自家模型,通过探索实现方案、缩短设计、测量和验证周期,帮助硬件团队在九个月内从初始设计推进到流片(Tapeout)。芯片完成后工作并未停止。
公司表示,AI 生成的 GPT-OSS 注意力机制和混合专家(mixture-of-experts)模块实现,运行速度比自家专家编写的版本快了 1.5 到 1.8 倍。这并不意味着整个模型运行速度提升那么多,但这确实展示了 OpenAI 对 Jalapeño 的期望:让芯片足够简单,使得 AI(不仅仅是人类)能够编程和优化。
工程师们描述工作时使用局部张量(local tensors)、显式通信和可预测的同步机制,为 AI 提供了一种方式来帮助确定工作负载如何在整个系统中映射、放置和调度。这可以加快芯片适配新模型的速度,不过 OpenAI 表示每个新模型系列仍然需要自己的内核和优化。
使用 Codex 与 GPT-Astra 及更早的 OpenAI 模型,硬件团队在两个月内将三个非 Jalapeño 原始生产计划的开放权重模型优化到了高性能水平。这与 OpenAI 对 Codex 的更宏大计划相符——公司已表示 Codex 仍处于早期开发阶段——并展示了它最终如何可能在编写代码之外发挥更广泛作用。
OpenAI 计划在今年年底前在其自有基础设施中部署 Jalapeño,并且已经在开发下一代和下下代产品。公司将继续使用来自英伟达和其他合作伙伴的加速器,但自主研发芯片使 OpenAI 能够更好地控制硬件与其模型的协同演进。
OpenAI 计划在今年年底前在其自有基础设施中部署 Jalapeño,并且已经在开发下一代和下下代产品。