Featured image of post OpenAI Jalapeño 芯片横空出世!700W 单芯片 13.4 PFLOPs,推理性能碾压 Nvidia Rubin!

OpenAI Jalapeño 芯片横空出世!700W 单芯片 13.4 PFLOPs,推理性能碾压 Nvidia Rubin!

如果你关注 AI 基础设施,昨天绝对是值得记住的一天。在 Hot Chips 大会上,OpenAI 的硬件负责人 Richard Ho 走上台,第一次公开了 Jalapeño——这颗传闻已久的自研推理芯片——的完整 Benchmark 数据。结果一出,整个芯片圈都坐不住了。

「底线是,这些结果显示了一个非常非常显著的性能进步,」Ho 在发布会上说,「Jalapeño 每瓦特可以服务更多 AI 工作,同时响应速度更快。」

这不是 PPT 上的 Promise。SemiAnalysis 的 InferenceX 基准测试给出了实打实的数字:Jalapeño 在 GPT-OSS 和 DeepSeek R1 上都跑出了比 Blackwell 更高的每用户吞吐量,功耗却低了一大截。

硬指标:规格对飙

先说核心参数。Jalapeño 是一颗单芯片(reticle-sized)ASIC,用 TSMC N3P 工艺制造,搭配 N3E I/O ChipletHBM4 内存(216 GiB,带宽 15.4 TB/s),TDP 只有 700W

而 Nvidia 同一代的 Rubin 呢?TDP 在 900-1,150W 之间。

参数 OpenAI Jalapeño Nvidia Rubin (Blackwell Ultra)
工艺 TSMC N3P TSMC N3P (估算)
FP4 算力 13.4 PFLOPs
FP8 算力 3.4 PFLOPs
内存 216 GiB HBM4
内存带宽 15.4 TB/s
TDP 700W 900-1,150W
每瓦性能比 1.5-1.9x vs Nvidia 基线
部署时间 2026 年底 (小规模) 2026-2027

Benchmark 方面,Jalapeño 在 DeepSeek R1 上跑出 700+ tok/s/user,GPT-OSS 上约 1,400 tok/s/user。OpenAI 自己的测试显示,Jalapeño 比 Nvidia Blackwell 每瓦多完成 1.5-1.9x 的推理工作。

架构揭秘:不要通用,只要极致

Jalapeño 最有趣的地方不是物理参数,而是它为了「只做推理」而做的激进取舍。

权重驻留脉动阵列

传统 GPU 的问题是:每条指令都要从内存读数据、做运算、写回。这个流程在通用计算中合理,但 LLM 推理的运算模式极其固定——输入的 prompt 数据流过固定的模型权重。

Jalapeño 的矩阵引擎采用了 weight-stationary systolic array(权重驻留脉动阵列)。模型权重一次性加载到处理网格中,「驻留」在原地(stationary),输入数据像血液泵过心脏一样,从一个处理单元直接流到下一个,不需要反复访问外部内存。

MXFP4:数位压缩到极限

传统 GPU 用 FP16/INT8,Jalapeño 用了 MXFP4(Microscaling FP4)。通过把数值分组共享指数(scaling factor),将模型权重压缩到 4-bit 精度,大幅减少存储和搬运的数据量。

这套搭配——权重驻留 + 脉动阵列 + MXFP 压缩——从根本上消除了数据搬运瓶颈。

超标量标量核 + 向量核

除了专用的矩阵引擎,Jalapeño 还配了:

  • 64-bit OoO 标量核:带 L1 缓存,提前流式加载数据到专用硬件队列,让矩阵引擎「到了就能干活」
  • FP32/INT32 向量核:处理 softmax、LayerNorm 等需要高精度的运算

这种分工很有意思:OoO 标量核「预加载」数据,向量核处理精度敏感的边角运算,矩阵引擎做主力——各司其职,没有通用 GPU 那种指令调度开销。

不止一颗芯片,是一整套「全栈」打法

Jalapeño 不是孤立的芯片项目。它是 OpenAI「全栈推理基础设施」战略的核心。

Gluon 编程语言

OpenAI 没有用 CUDA。他们自研了 Gluon 内核编程语言——一个在芯片、模型、运行时三层同时优化的编译栈。这意味着 OpenAI 可以像 Apple 做 M 系列那样:芯片设计时就考虑了自家模型的计算图特征,反过来模型推理时又知道芯片的精确微架构。

训练阶段的整合

更有意思的是,OpenAI 用自家模型来设计芯片。「OpenAI’s own models assisted in the development process,」Ho 透露。模型在训练阶段就已经参与芯片设计——这已经不是传统的「芯片造好再跑模型」,而是模型和芯片在设计中互相反馈。

多代平台路线图

OpenAI 明确把 Jalapeño 定位为 multigenerational platform(多代平台),不是一次性项目。后续每一代都会集成 AI 产品、模型、芯片、内存的联合优化。

10 GW 的算力赌注

Jalapeño 不是实验室样品。它是 OpenAI 10 GW 基础设施路线图(至 2029 年) 的核心引擎。10 GW 什么概念?约等于 10 个大型核电站的供电量。在这个规模上,每瓦效率的每一点提升都以亿美元计。

Richard Ho 估计 Jalapeño 将在 2026 年底小规模部署,2027 年才会大规模铺开。这个节奏与 Nvidia Rubin 的量产时间大致重叠——一场正面碰撞已在酝酿。

给 Nvidia 的 CUDA 护城河敲了一锤

Jalapeño 告诉我们一个更重要的趋势:AI 推理正在从 GPU 的「通用计算」向 ASIC 的「专用计算」迁移

H100/B200 的通用性是一种保护——如果你不确定模型架构的未来走向,你买 GPU 总是安全的。但当你像 OpenAI 这样,年推理量以千亿 tokens 计,你每瓦多省 40% 就意味着每年节省数亿美元的电费。这时定制 ASIC 的 ROI 就不可抗拒了。

Spheron 的一位工程师说得直白:「Jalapeño 是令人印象深刻的芯片,但只有 OpenAI 自己能用。如果你跑开源权重模型,你的路径仍然是 GPU 云。」

这恰恰是 Nvidia 的悖论:传统上 GPU 的「CUDA 护城河」靠的是软件生态锁定。但 Jalapeño 用 Gluon 完全绕过 CUDA,从硬件 + 编译器层面重新定义推理栈。CUDA 再强,也拦不住你在自家芯片上跑自家模型。

当然,Cerebras CS-4 已经在用 Wafer-Scale 走另一条路——你可以在《Cerebras CS-4 横空出世!》看到另一场对阵 Nvidia 的战斗。

写在最后

Jalapeño 的发布是 AI 基础设施史上的分水岭时刻。它标志着世界最大的 AI 公司正式告别纯 GPU 依赖,开始用自己的芯片定义自己的算力未来。

但别忘了两面性:定制 ASIC 的高效率来自高特异性。如果未来模型架构发生根本性变化(比如从 Transformer 迁移到 State Space 或 Neural Operators),Jalapeño 的脉动阵列就是个硬编码的赌注。OpenAI 的多代平台策略正是为此预留的缓冲。

而对于我们这些不在 OpenAI 的人——GPU 仍然是唯一的选择。下一个值得关注的问题不是「Jalapeño 有多强」,而是「什么时候 ASIC 设计变得足够便宜,让中等规模的 AI 公司也能负担得起定制芯片」。

那天可能比你想的要近。

By AI博士 万戈