事件专题 ·多源确认

OpenAI 发布自研 AI 推理芯片 Jalapeno 的完整架构

OpenAI 在 Hot Chips 2026 大会上公布了自研 AI 推理芯片 Jalapeno 的完整架构。这是 OpenAI 与 Broadcom 联合开发的第一颗定制推理加速器,采用台积电 3nm 工艺,配备 6 颗 HBM4 内存堆叠。设计目标很明确:不追求纸面算力,力求 ChatGPT 和 API 用户感受到更快的响应速度。这篇来自 Silicon Co-Design 的深度技术分析,把这颗芯片的架构设计逻辑拆得很透。以下是几个值得关注的要点。 1. 设计出发点:用户体验第一,不追求跑分 传统芯片厂商习惯用峰值算力(所谓"show FLOPS")来定义产品。OpenAI 反过来,从用户端的延迟体验倒推硬件指标。他们关心的核心指标是:第一个 Token 出来有多快(TTFT)、每个 Token 之间隔多久(TPOT)、整个请求从头到尾多长时间。 这个思路决定了后续所有架构选择。 2. 关键规格 单颗 Jalapeno 功耗 700W(实测通常在 550W 以下),FP4 算力最高 13.4 PFLOPS,FP8 算力 3.4 PFLOPS,内存容量 216 GiB,带宽 15.4 TB/s。作为参照,NVIDIA 的 GB300 功耗 1400W,内存 288GB(HBM3E)。换算下来,Jalapeno 每瓦的内存容量大约是 GB300 的 1.5 倍。 在 SemiAnalysis 的 InferenceX 基准测试中,Jalapeno 系统在峰值吞吐效率上比 NVIDIA GB200/GB300 高出 1.5 到 1.9 倍(按每千瓦算力计),端到端延迟低 1.7 到 3.6 倍。跑 DeepSeek R1 的 8K 输入 + 1K 输出测试时,端到端延迟从对照系统的 5.99 秒降到了 1.65 秒。 需要说明的是,这些测试还没跟 NVIDIA 即将出货的下一代 Vera Rubin(同样使用 HBM4)做过对比。SemiAnalysis 自己也指出,Jalapeno 真正的对手是 Rubin,而非 Blackwell。 3. 架构上的几个关键选择 第一,空间架构(Spatial Architecture)。传统 GPU 用大量线程调度器统一协调成千上万个线程,Jalapeno 则把 64 个计算核心各自配上专属 HBM 接口,核心之间通过专用的集合通信网络直连。每个核心独立运行,不用等中央调度器分发指令。好处是延迟更可控,坏处是编程更复杂。 为了降低编程门槛,OpenAI 开发了一套叫 Gluon 的编程语言,基于开源编译器 Triton 构建。开发者可以用类似 GPU 线程块的写法来编程,不用手动设计空间数据流图。 第二,单芯片方案。理论上可以给预填充(Prefill)、推测解码(Speculate)、解码(Decode)三个阶段各设计一颗专用芯片,但 OpenAI 选择把所有功能集成在一颗通用芯片上。理由是:各阶段的工作量比例随模型和请求变化剧烈,专用芯片会导致某些加速器长期闲置。OpenAI 硬件团队的 Ravi Narayanaswami 的说法是,"未来缺少某个功能的机会成本,比现在多塞一些暂时用不满的晶体管的边际成本要高得多"。 第三,网络拓扑。Jalapeno 采用 Broadcom 的 Tomahawk 6 交换芯片(全球首颗 102.4Tbps 以太网交换芯片),搭建了一个两跳 Clos 拓扑:本地域一颗 TH6 连 128 颗 Jalapeno,全局域八颗 TH6 再把 2048 颗芯片串起来。任意两颗芯片之间最多两跳到达。相比 NVIDIA 常用的三跳胖树拓扑,跳数少意味着尾延迟更可预测。 第四,多 Token 预测(Multi-Token Prediction)。传统的自回归解码是一个接一个生成 Token,每个都要完整读一遍模型权重,严重受制于内存带宽。Jalapeno 的架构从底层支持多 Token 预测:用一个轻量级的草稿模型一次猜 5-10 个 Token,再用大模型一次性验证。OpenAI 称,启用多 Token 预测后延迟还能再降 3 到 5 倍。不过目前的基准测试都是在单 Token 模式下跑的,多 Token 预测尚未启用。 4. AI 辅助设计芯片 从 2024 年 10 月立项到流片,Jalapeno 的 RTL 开发到交付只用了大约 9 个月。OpenAI 借助了 Google 开源的 XLS 工具做高层次综合(High-Level Synthesis),用自家的前沿模型来辅助模块级优化和形式验证。这篇分析文章的作者认为,与其说 AI 让某个具体步骤变快了,不如说它让芯片设计可以更快地在不同方案之间迭代——这对缩短周期的贡献可能更大。 5. 行业意义 OpenAI 走了一条和 Google(TPU)类似的路:自研芯片来优化自家模型的推理效率。但 OpenAI 硬件副总裁 Richard Ho 在发布会后对彭博社明确表示,"NVIDIA 是非常好的合作伙伴,我们仍然需要大量 NVIDIA 芯片。" Jalapeno 的定位是补充而非替代,至少现阶段如此。 据报道,第二代 Jalapeno 可能在几个月内完成流片,第三代也已在开发中。对于普通用户来说,最直接的影响是:如果 OpenAI 能把更多推理负载迁移到自研芯片上,ChatGPT 和 API 的响应速度有望进一步加快,而 OpenAI 的推理成本也会下降——这最终会反映在定价或服务质量上。 如果你关注这个领域的话推荐阅读原文(后两部分需要订阅才能解锁): siliconcodesign.com/p/an-advanced-… Chad Wallace @siliconcodesign An advanced system architecture breakdown of OpenAI’s Jalapeno inference accelerator that goes beyond raw FLOPs and into the surrounding network architecture and how AI actually added value: siliconcodesign.com/p/an-advanced-… 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 341 📊 1 ⚡

当前结论

OpenAI 和 Broadcom 联合发布了自研的 AI 推理芯片 Jalapeno,专门为了提升 ChatGPT 的响应速度,比 NVIDIA 的芯片更省电,延迟更低。

11 个信源88° AI 热度最后更新 2026/9/12 18:10:51

证据链

11 个信源
相关来源 4The Business Times: Tech
查看原文
相关来源 9Clement Delangue
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。