Jalapeño在InferenceX基准测试中,每用户token吞吐量和每千瓦能效均超越当前最优方案,对大规模AI部署的硬件选型有直接参考价值。
在周二的 Hot Chips 大会上,OpenAI 分享了 Jalapeño 的更多细节,包括该系统的首批基准测试结果。在 Semianalysis 的 InferenceX 基准测试中,Jalapeño 在每用户 token 数和每千瓦吞吐量上均超越了目前可用的最先进推理处理器。
"结论是,结果表明相较于最先进水平有了非常、非常显著的性能提升,"OpenAI 硬件负责人 Richard Ho 在媒体电话会上表示。"Jalapeño 每单位功率可以处理更多的 AI 工作负载,同时响应速度也更快。它在为大量客户提供服务方面效率很高,同时也能实现极低延迟。"
值得注意的是,这一对比是针对 Nvidia Blackwell 系统的——但到 Jalapeño 全面部署时,竞争格局可能已经发生了重大变化。Ho 估计 Jalapeño 将在 2026 年底"以非常小的规模"部署,更大规模的部署将在 2027 年到来。
Jalapeño 去年 10 月首次公布,由 OpenAI 与 Broadcom 紧密合作开发,OpenAI 自身的模型也参与了开发过程。公司计划将 Jalapeño 打造成一个多代际平台,使 AI 产品、模型、芯片和内存能够协同开发。
由于这种全栈式方法,OpenAI 能够解决推理过程中经常产生摩擦的特定阶段。特别是 Jalapeño 旨在最小化处理过程中 prefill 和通信阶段的延迟,OpenAI 表示这些阶段通常会成为瓶颈。
"我们设计 Jalapeño 的目的是最小化数据移动和通信延迟,"公司在展示结果的博客文章中表示。"这意味着模型状态(包括生成响应时使用的 KV cache)可以明确地放置并保持在本地,同时系统为每个推理阶段激活正确的计算、内存和网络组合。"