OpenAI用LLM辅助设计Jalapeño芯片,IEEE详细报道了LLM如何在芯片布局和参数优化中发挥作用,HN热度199。
AI 大幅缩短了设计周期;这只是开始
Matthew S. Smith 是 IEEE Spectrum 的特约编辑,曾任 Digital Trends 首席评测编辑。
OpenAI 的 Jalapeño 将计算芯片与六堆叠 HBM4 及一个 I/O 芯片配对使用。
8 月 25 日,OpenAI 全面揭晓了 Jalapeño——这家公司的首款 AI 加速器芯片。Jalapeño 可提供高达 13.4 petaflops 的 4 位计算能力,访问 232 GB 的最先进内存,以惊人的 15.4 TB/s 的速度与之通信。OpenAI 引用的基准测试显示,与 Nvidia 的 GB300——OpenAI 目前赖以生存的芯片——相比,Jalapeño 可将端到端延迟(从 prompt 到最后一个 token 的时间)降低最多 3.6 倍,同时功耗更低。
这些数字在 Jalapeño 广泛部署于 OpenAI 推理集群后能否转化为实际收益尚待观察,但性能只是故事的一半。另一半是芯片的设计方式——这个过程如你所想,被 OpenAI 的大型语言模型(LLM)加速了。Jalapeño 从首个架构概念到首次流片(first silicon)只用了不到 20 个月。从首个 RTL——定义芯片逻辑的寄存器传输级代码——到 tape-out(将最终设计送往制造),只相隔了 9 个月。
这是一个快速的时间线,但专家认为,随着 LLM 的改进并更深入地集成到芯片设计工具中,这个速度很快就会显得慢了。OpenAI 不出意料地对这个机会持乐观态度。"模型给了我们的工程师超能力,"OpenAI 硬件副总裁 Richard Ho 表示。"我们的工程师仍在驱动这项工作。他们仍然是最终裁决者。但他们可以做得更快。他们可以探索更多的路径。"
OpenAI 以小型设计团队实现了快速成果
Ho 表示,设计 Jalapeño 的团队在整个项目期间平均不到 100 人,目前在追求第二代和第三代设计时仍维持在约 100 人左右。这个数字包含了硬件团队中广泛的角色范围,从系统设计到软件和供应链,但不包括与 OpenAI 合作该项目的 Broadcom 员工。
OpenAI 与 Broadcom 之间的劳动分工大致分为设计和实现。OpenAI 团队负责端到端系统设计,包括推理加速器、内存层次结构和网络。Broadcom 负责"从门级开始的物理设计",Ho 说。与 Broadcom 的合作抑制了一些人对 OpenAI 速度的看法。Verkor.io(一家代理芯片设计初创公司)的联合创始人 David Chin 表示:"他们给我们的时间表是相当可信的,"但他认为 Broadcom 的帮助对 Jalapeño 的快速时间线至关重要。"如果你让另一个人从零开始,那是不可能的,"他说。Verkor 的另一位联合创始人 Ravi Krishna 称 OpenAI 的速度"是一个相当令人印象深刻的结果",但他补充说,他预计 LLM 能力的改进,如果项目从今天开始,可能会带来更快的速度。
加州大学圣地亚哥分校的杰出教授 Andrew Kahng 也对 OpenAI 的速度印象深刻,称其"今天可能是同类最佳"。Kahng 回忆起 2016 年他共同组织的 IEEE 设计自动化未来研讨会。该研讨会包括 Richard Ho(当时是 Google 的一名工程师)作为主题演讲者。Ho 对设计自动化有强烈的看法,并将完成芯片设计所需的时间定义为一个团队每天可以完成的迭代次数的函数。
OpenAI 的 LLM 如何加速 Jalapeño 的设计
"自动化本身在芯片设计中已经存在了几十年。这不是一个新问题,"马里兰大学学院 Park 分校半导体倡议与创新主任 Ankur Srivastava 说。然而,LLM 与先前自动化工具的不同之处在于它们理解语言和代码的能力。他说,这使它们特别适合芯片设计任务中"仍处于问题的语言领域"的部分。
OpenAI 的团队设计了一个利用这一优势的工作流程。OpenAI 的前端工作流程围绕 Accelerated Hardware Synthesis(XLS)构建,这是一种开源的高级综合工具链,最初由 Google 开发。高级综合是一种芯片设计自动化形式,允许工程师在更熟悉编程环境中设计芯片。就 XLS 而言,芯片设计者可以用 DSLX(一种受 Rust 启发的领域特定语言)和 C++ 等语言编写。然后 XLS 将这些转换为 Verilog——一种用于描述电子系统的硬件描述语言。
"我们在思考如何利用 AI 使项目更快,而 AI 在处理软件类事物方面要好得多,"OpenAI 技术人员的 Chris Leary 说。"XLS 在某些方面看起来像软件,所以它得到了那个好处。"Leary 非常熟悉 XLS 应该如何运作也有所帮助,因为他在 Google 期间就启动了它。
Kahng 同意使用 AI 加速高级综合(如 XLS)的决定是合理的,因为它是"LLM 更自然地工作"的对象,并提供了快速迭代的机会。"我认为这是一个普遍有用的工作流程,而且它是一个'有长久生命力'的工作流程,"他说。
同样的逻辑促使 Jalapeño 团队专注于软件优化。当首批芯片于 5 月从代工厂回来时,团队将其内部 AI 模型指向设计运行基准测试的软件,如 SemiAnalysis 的 InferenceX。在 DeepSeek 的多头潜在注意力内核基准测试中,性能从理论上限(由芯片的计算和内存带宽设定)的 0.31% 上升到 88.94%,大约用了 40 小时。Ho 表示这个结果是可重复的,因此从代工厂交付首批芯片到生产爬坡之间的时间可以缩短。"我们所有的调度假设都将基于我们现在拥有这一能力这一事实,"他说。

虽然 Jalapeño 团队的 AI 辅助工作流程的大致轮廓是由 Ho 和 Leary 提前猜测的,但 OpenAI 模型改进确实带来了一些惊喜。
Leary 表示,该项目开始时得到了 OpenAI o3 等模型的帮助(o3 于 2025 年 4 月向公众发布,但更早的时候就对 Jalapeño 团队可用)。然而,当项目完成时,团队已经可以访问 GPT-6 Astra 前身的模型,这些模型要到 2026 年 9 月 3 日才公开发布。Leary 说,更新的模型可以直接在 Verilog 中工作,无需从普通编程语言通过 XLS 翻译,而且它接近于能够独立操作专有设计工具。
Ho 还证实,团队可以访问针对芯片设计微调的内部 LLM,这些 LLM 不向公众提供。他拒绝详细说明使用的模型。然而,他补充说,Jalapeño 团队与 OpenAI 的研究团队合作。虽然并非所有用于设计 Jalapeño的特定模型都公开发布,但 Ho 表示,目标是将从该项目中学到的教训带入公司的商业 LLM。"可以肯定地说,Astra 及后续模型将在芯片设计方面表现得非常好,"他说。
AI 对后端优化的用处较小,但这种情况可能会改变
如前所述,OpenAI 在 Jalapeño 上的大部分工作集中在芯片设计的"前端",这涵盖了将芯片从最初概念、通过编写 RTL 代码定义设计、再到验证设计在物理实现时将工作的任务。大部分"后端"设计——包括路由互连、完成和验证时钟和电源规格、以及将所需设计信息发送给代工厂等任务——被移交给 Broadcom,由该公司将芯片推向生产。
这并不是说 OpenAI 的工作流程忽略了后端。Jalapeño 团队包括物理设计工程师,他们与 Broadcom 的同行合作,提供关于芯片布局规划(floor plan)和布线等方面的指导。在 2026 年 IEEE Hot Chips 大会上,Ho 和 Leary 给出了 AI 引导物理设计优化的具体提升数字,包括矩阵乘法单元相比优化后人工基准的面积减少 10%。换句话说,OpenAI 声称 AI 引导的优化帮助在相同面积的硅上设计出比以前更多的电路。
Broadcom 使用了自己的内部工作流程。该公司的团队无法访问 OpenAI 用于帮助设计 Jalapeño 的内部模型,但确实可以使用 OpenAI 的公开商业模型。
Verkor 的 Ravi Krishna 表示,OpenAI 的后端设计方法已经显得有些保守。他认为这是该项目于 2024 年 10 月开始时所处时代的产物。"过去四五个月的模型已经改进。从(2026 年)4 月开始……才是它们真正开始能够更好地处理这些任务的时候,"他说。Verkor 联合创始人 Suresh Krishna 表示同意,说"没有理由不能有一个代理循环来大幅加速这个过程的后端。"
Ho 和 Leary 还暗示,用于设计 Jalapeño 的工作流程与团队下一次的努力相比可能显得老式。
"正如你所能想象的,对于(Jalapeño),我们试图尽可能快地推进。所以在'我们是想花时间做一些创新,还是想做我们历史上知道有效的事情?'之间存在权衡,"Leary 说。"对于第二代,我们有一种重置机会来询问所有我们想要设置的事情。"
Ho 表示,第二代芯片的工作流程"有很多地方我们正在引入 [AI]"。他提到在验证和物理设计中使用 AI 做更多工作的机会。Leary 补充说,团队现在有自动波形操作和查看工具。这自动化了分析,以识别与故障相关的芯片时钟信号,并可以在芯片仍在设计时改进硬件调试。尽管有这些预期的改进,Ho 和 Leary 明确表示,他们不认为芯片设计可以完全自动化。"我们并不是说任何人都可以来仅仅使用 [OpenAI 的编码平台] Codex 构建最先进的尖端 AI/ML 加速器芯片,"Ho 解释道。"我们说的是关于如何更好地使用 Codex 以及我们如何专注于小型团队和快速时间线来达到高质量结果的一些非常具体的事情。"
Matthew S. Smith 是一名拥有 17 年经验的自由消费科技记者,曾任 Digital Trends 首席评测编辑。作为 IEEE Spectrum 特约编辑,他报道以显示创新、人工智能和增强现实为重点的消费科技。作为复古计算爱好者,Matthew 在他的 YouTube 频道 Computer Gaming Yesterday 报道复古电脑和电脑游戏。