<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Broadcom on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/broadcom/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Wed, 26 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/broadcom/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>OpenAI Jalapeño 芯片横空出世！700W 单芯片 13.4 PFLOPs，推理性能碾压 Nvidia Rubin！</title>
        <link>https://www.yesmiracle.net/post/20260826-openai-jalapeno-chip/</link>
        <pubDate>Wed, 26 Aug 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260826-openai-jalapeno-chip/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260826-openai-jalapeno-chip/cover.svg" alt="Featured image of post OpenAI Jalapeño 芯片横空出世！700W 单芯片 13.4 PFLOPs，推理性能碾压 Nvidia Rubin！" /&gt;&lt;p&gt;如果你关注 AI 基础设施，昨天绝对是值得记住的一天。在 Hot Chips 大会上，OpenAI 的硬件负责人 Richard Ho 走上台，第一次公开了 Jalapeño——这颗传闻已久的自研推理芯片——的完整 Benchmark 数据。结果一出，整个芯片圈都坐不住了。&lt;/p&gt;
&lt;p&gt;「底线是，这些结果显示了一个非常非常显著的性能进步，」Ho 在发布会上说，「Jalapeño 每瓦特可以服务更多 AI 工作，同时响应速度更快。」&lt;/p&gt;
&lt;p&gt;这不是 PPT 上的 Promise。SemiAnalysis 的 InferenceX 基准测试给出了实打实的数字：Jalapeño 在 GPT-OSS 和 DeepSeek R1 上都跑出了比 Blackwell 更高的每用户吞吐量，功耗却低了一大截。&lt;/p&gt;
&lt;h2 id=&#34;硬指标规格对飙&#34;&gt;硬指标：规格对飙&lt;/h2&gt;
&lt;p&gt;先说核心参数。Jalapeño 是一颗单芯片（reticle-sized）ASIC，用 &lt;strong&gt;TSMC N3P&lt;/strong&gt; 工艺制造，搭配 &lt;strong&gt;N3E I/O Chiplet&lt;/strong&gt; 和 &lt;strong&gt;HBM4 内存&lt;/strong&gt;（216 GiB，带宽 15.4 TB/s），TDP 只有 &lt;strong&gt;700W&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;而 Nvidia 同一代的 Rubin 呢？TDP 在 900-1,150W 之间。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;参数&lt;/th&gt;
          &lt;th&gt;OpenAI Jalapeño&lt;/th&gt;
          &lt;th&gt;Nvidia Rubin (Blackwell Ultra)&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;工艺&lt;/td&gt;
          &lt;td&gt;TSMC N3P&lt;/td&gt;
          &lt;td&gt;TSMC N3P (估算)&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;FP4 算力&lt;/td&gt;
          &lt;td&gt;13.4 PFLOPs&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;FP8 算力&lt;/td&gt;
          &lt;td&gt;3.4 PFLOPs&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;内存&lt;/td&gt;
          &lt;td&gt;216 GiB HBM4&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;内存带宽&lt;/td&gt;
          &lt;td&gt;15.4 TB/s&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;TDP&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;700W&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;900-1,150W&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;每瓦性能比&lt;/td&gt;
          &lt;td&gt;1.5-1.9x vs Nvidia&lt;/td&gt;
          &lt;td&gt;基线&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;部署时间&lt;/td&gt;
          &lt;td&gt;2026 年底 (小规模)&lt;/td&gt;
          &lt;td&gt;2026-2027&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Benchmark 方面，Jalapeño 在 DeepSeek R1 上跑出 &lt;strong&gt;700+ tok/s/user&lt;/strong&gt;，GPT-OSS 上约 &lt;strong&gt;1,400 tok/s/user&lt;/strong&gt;。OpenAI 自己的测试显示，Jalapeño 比 Nvidia Blackwell 每瓦多完成 &lt;strong&gt;1.5-1.9x&lt;/strong&gt; 的推理工作。&lt;/p&gt;
&lt;h2 id=&#34;架构揭秘不要通用只要极致&#34;&gt;架构揭秘：不要通用，只要极致&lt;/h2&gt;
&lt;p&gt;Jalapeño 最有趣的地方不是物理参数，而是它为了「只做推理」而做的激进取舍。&lt;/p&gt;
&lt;h3 id=&#34;权重驻留脉动阵列&#34;&gt;权重驻留脉动阵列&lt;/h3&gt;
&lt;p&gt;传统 GPU 的问题是：每条指令都要从内存读数据、做运算、写回。这个流程在通用计算中合理，但 LLM 推理的运算模式极其固定——输入的 prompt 数据流过固定的模型权重。&lt;/p&gt;
&lt;p&gt;Jalapeño 的矩阵引擎采用了 &lt;strong&gt;weight-stationary systolic array&lt;/strong&gt;（权重驻留脉动阵列）。模型权重一次性加载到处理网格中，「驻留」在原地（stationary），输入数据像血液泵过心脏一样，从一个处理单元直接流到下一个，不需要反复访问外部内存。&lt;/p&gt;
&lt;h3 id=&#34;mxfp4数位压缩到极限&#34;&gt;MXFP4：数位压缩到极限&lt;/h3&gt;
&lt;p&gt;传统 GPU 用 FP16/INT8，Jalapeño 用了 &lt;strong&gt;MXFP4&lt;/strong&gt;（Microscaling FP4）。通过把数值分组共享指数（scaling factor），将模型权重压缩到 4-bit 精度，大幅减少存储和搬运的数据量。&lt;/p&gt;
&lt;p&gt;这套搭配——权重驻留 + 脉动阵列 + MXFP 压缩——从根本上消除了数据搬运瓶颈。&lt;/p&gt;
&lt;h3 id=&#34;超标量标量核--向量核&#34;&gt;超标量标量核 + 向量核&lt;/h3&gt;
&lt;p&gt;除了专用的矩阵引擎，Jalapeño 还配了：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;64-bit OoO 标量核&lt;/strong&gt;：带 L1 缓存，提前流式加载数据到专用硬件队列，让矩阵引擎「到了就能干活」&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;FP32/INT32 向量核&lt;/strong&gt;：处理 softmax、LayerNorm 等需要高精度的运算&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这种分工很有意思：OoO 标量核「预加载」数据，向量核处理精度敏感的边角运算，矩阵引擎做主力——各司其职，没有通用 GPU 那种指令调度开销。&lt;/p&gt;
&lt;h2 id=&#34;不止一颗芯片是一整套全栈打法&#34;&gt;不止一颗芯片，是一整套「全栈」打法&lt;/h2&gt;
&lt;p&gt;Jalapeño 不是孤立的芯片项目。它是 OpenAI「全栈推理基础设施」战略的核心。&lt;/p&gt;
&lt;h3 id=&#34;gluon-编程语言&#34;&gt;Gluon 编程语言&lt;/h3&gt;
&lt;p&gt;OpenAI 没有用 CUDA。他们自研了 &lt;strong&gt;Gluon&lt;/strong&gt; 内核编程语言——一个在芯片、模型、运行时三层同时优化的编译栈。这意味着 OpenAI 可以像 Apple 做 M 系列那样：芯片设计时就考虑了自家模型的计算图特征，反过来模型推理时又知道芯片的精确微架构。&lt;/p&gt;
&lt;h3 id=&#34;训练阶段的整合&#34;&gt;训练阶段的整合&lt;/h3&gt;
&lt;p&gt;更有意思的是，OpenAI 用自家模型来设计芯片。「OpenAI&amp;rsquo;s own models assisted in the development process,」Ho 透露。模型在训练阶段就已经参与芯片设计——这已经不是传统的「芯片造好再跑模型」，而是模型和芯片在设计中互相反馈。&lt;/p&gt;
&lt;h3 id=&#34;多代平台路线图&#34;&gt;多代平台路线图&lt;/h3&gt;
&lt;p&gt;OpenAI 明确把 Jalapeño 定位为 &lt;strong&gt;multigenerational platform&lt;/strong&gt;（多代平台），不是一次性项目。后续每一代都会集成 AI 产品、模型、芯片、内存的联合优化。&lt;/p&gt;
&lt;h2 id=&#34;10-gw-的算力赌注&#34;&gt;10 GW 的算力赌注&lt;/h2&gt;
&lt;p&gt;Jalapeño 不是实验室样品。它是 OpenAI &lt;strong&gt;10 GW 基础设施路线图（至 2029 年）&lt;/strong&gt; 的核心引擎。10 GW 什么概念？约等于 10 个大型核电站的供电量。在这个规模上，每瓦效率的每一点提升都以亿美元计。&lt;/p&gt;
&lt;p&gt;Richard Ho 估计 Jalapeño 将在 &lt;strong&gt;2026 年底小规模部署&lt;/strong&gt;，2027 年才会大规模铺开。这个节奏与 Nvidia Rubin 的量产时间大致重叠——一场正面碰撞已在酝酿。&lt;/p&gt;
&lt;h2 id=&#34;给-nvidia-的-cuda-护城河敲了一锤&#34;&gt;给 Nvidia 的 CUDA 护城河敲了一锤&lt;/h2&gt;
&lt;p&gt;Jalapeño 告诉我们一个更重要的趋势：&lt;strong&gt;AI 推理正在从 GPU 的「通用计算」向 ASIC 的「专用计算」迁移&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;H100/B200 的通用性是一种保护——如果你不确定模型架构的未来走向，你买 GPU 总是安全的。但当你像 OpenAI 这样，年推理量以千亿 tokens 计，你每瓦多省 40% 就意味着每年节省数亿美元的电费。这时定制 ASIC 的 ROI 就不可抗拒了。&lt;/p&gt;
&lt;p&gt;Spheron 的一位工程师说得直白：&lt;strong&gt;「Jalapeño 是令人印象深刻的芯片，但只有 OpenAI 自己能用。如果你跑开源权重模型，你的路径仍然是 GPU 云。」&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这恰恰是 Nvidia 的悖论：传统上 GPU 的「CUDA 护城河」靠的是软件生态锁定。但 Jalapeño 用 Gluon 完全绕过 CUDA，从硬件 + 编译器层面重新定义推理栈。CUDA 再强，也拦不住你在自家芯片上跑自家模型。&lt;/p&gt;
&lt;p&gt;当然，Cerebras CS-4 已经在用 Wafer-Scale 走另一条路——你可以在&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260819-cerebras-cs-4-wafer-scale-inference/&#34; &gt;《Cerebras CS-4 横空出世！》&lt;/a&gt;看到另一场对阵 Nvidia 的战斗。&lt;/p&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;
&lt;p&gt;Jalapeño 的发布是 AI 基础设施史上的分水岭时刻。它标志着世界最大的 AI 公司正式告别纯 GPU 依赖，开始用自己的芯片定义自己的算力未来。&lt;/p&gt;
&lt;p&gt;但别忘了两面性：&lt;strong&gt;定制 ASIC 的高效率来自高特异性&lt;/strong&gt;。如果未来模型架构发生根本性变化（比如从 Transformer 迁移到 State Space 或 Neural Operators），Jalapeño 的脉动阵列就是个硬编码的赌注。OpenAI 的多代平台策略正是为此预留的缓冲。&lt;/p&gt;
&lt;p&gt;而对于我们这些不在 OpenAI 的人——GPU 仍然是唯一的选择。下一个值得关注的问题不是「Jalapeño 有多强」，而是「什么时候 ASIC 设计变得足够便宜，让中等规模的 AI 公司也能负担得起定制芯片」。&lt;/p&gt;
&lt;p&gt;那天可能比你想的要近。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
