<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>GPU替代 on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/gpu%E6%9B%BF%E4%BB%A3/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Wed, 19 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/gpu%E6%9B%BF%E4%BB%A3/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Cerebras CS-4 横空出世！Wafer-Scale 芯片集群 30 倍碾压 GPU，推理速度飙到 4400 tokens/s！</title>
        <link>https://www.yesmiracle.net/post/20260819-cerebras-cs-4-wafer-scale-inference/</link>
        <pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260819-cerebras-cs-4-wafer-scale-inference/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260819-cerebras-cs-4-wafer-scale-inference/cover.svg" alt="Featured image of post Cerebras CS-4 横空出世！Wafer-Scale 芯片集群 30 倍碾压 GPU，推理速度飙到 4400 tokens/s！" /&gt;&lt;p&gt;如果你没听说过 Cerebras，只需要知道一件事：他们的 AI 芯片有盘子那么大。&lt;/p&gt;
&lt;p&gt;不是比喻——是真的盘子那么大。一整片 46,225 mm² 的晶圆，上面躺着 4 万亿个晶体管、90 万个核心、44 GB 的 SRAM，直接当一颗芯片用。这个思路跟 Nvidia 把大芯片切成小 chiplet 然后拼回去的做法完全相反。&lt;/p&gt;
&lt;p&gt;昨天，Cerebras 发布了第四代系统——&lt;strong&gt;CS-4&lt;/strong&gt;，顺便带来了一个 turbo 版的 Wafer-Scale Engine。核心数字是：推理速度比 GPU 方案&lt;strong&gt;快 30 倍&lt;/strong&gt;，每瓦吞吐量比上代 CS-3 提升&lt;strong&gt;10 倍&lt;/strong&gt;。在 GPT-OSS-120B 这个量级的模型上，单 CS-4 系统就能跑到 &lt;strong&gt;4,400 tokens/s&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;而最让我觉得有意思的，不是这些数字本身，而是他们怎么做到的。&lt;/p&gt;
&lt;h3 id=&#34;wse-3t-turbo28-ghz-的秘密&#34;&gt;WSE-3T Turbo：2.8 GHz 的秘密&lt;/h3&gt;
&lt;p&gt;如果你看 WSE-3T 的规格表，会觉得 Cerebras 在玩魔术：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;参数&lt;/th&gt;
          &lt;th&gt;WSE-3&lt;/th&gt;
          &lt;th&gt;WSE-3T&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;晶圆面积&lt;/td&gt;
          &lt;td&gt;46,225 mm²&lt;/td&gt;
          &lt;td&gt;46,225 mm²&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;制程&lt;/td&gt;
          &lt;td&gt;TSMC 5nm&lt;/td&gt;
          &lt;td&gt;TSMC 5nm&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;晶体管数&lt;/td&gt;
          &lt;td&gt;4 万亿&lt;/td&gt;
          &lt;td&gt;4 万亿&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;核心数&lt;/td&gt;
          &lt;td&gt;900,000&lt;/td&gt;
          &lt;td&gt;900,000&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;SRAM&lt;/td&gt;
          &lt;td&gt;44 GB&lt;/td&gt;
          &lt;td&gt;44 GB&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;稀疏 FP16&lt;/td&gt;
          &lt;td&gt;125 PFLOPS&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;250 PFLOPS&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;稠密 FP16&lt;/td&gt;
          &lt;td&gt;12.5 PFLOPS&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;25 PFLOPS&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;内存带宽&lt;/td&gt;
          &lt;td&gt;21.6 PB/s&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;43.2 PB/s&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;单晶圆功耗&lt;/td&gt;
          &lt;td&gt;15 kW&lt;/td&gt;
          &lt;td&gt;~33 kW&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;系统功耗&lt;/td&gt;
          &lt;td&gt;23 kW&lt;/td&gt;
          &lt;td&gt;~46 kW&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;看到了吗？晶圆面积没变，制程没变，晶体管数没变，连 SRAM 容量都没变——但所有性能指标都翻了一倍。&lt;/p&gt;
&lt;p&gt;这不是新芯片，而是&lt;strong&gt;把同一颗芯片推到两倍的频率&lt;/strong&gt;。The Register 的推测是 WSE-3T 跑到了 &lt;strong&gt;2.8 GHz&lt;/strong&gt;，而上代 WSE-3 是 1.4 GHz。&lt;/p&gt;
&lt;p&gt;把芯片频率翻倍不是新鲜事——难的是怎么把两倍的功率送进去、把两倍的热散出来。Cerebras 的秘密武器是 &lt;strong&gt;Wafer-Scale Backpack&lt;/strong&gt;：一个直接贴在晶圆背面的模块，把电源转换从原来距离芯片 50 mm 的位置压缩到 0.5 mm。板级损耗大幅降低，于是能推两倍的功率过去。&lt;/p&gt;
&lt;p&gt;这比流片一颗新芯片快太多了。不对——这比流片一颗&lt;strong&gt;盘子大的新芯片&lt;/strong&gt;快太多了。在 5nm 节点上流一片 46,225 mm² 的晶圆，一次就要几千万美元，周期至少半年。Turbo 策略意味着 Cerebras 可以在不重新流片的情况下，每 18 个月把性能翻倍。&lt;/p&gt;
&lt;h3 id=&#34;cs-4-rack三倍密度nexus-架构登场&#34;&gt;CS-4 Rack：三倍密度，Nexus 架构登场&lt;/h3&gt;
&lt;p&gt;CS-4 不止是单芯片升级，而是一个完整的机架级系统：&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;┌───────────────────────────────────────────────────┐
│                    CS-4 Rack                       │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐        │
│  │ Backpack │  │ Backpack │  │ Backpack │        │
│  │  WSE-3T  │  │  WSE-3T  │  │  WSE-3T  │        │
│  │  250 PF  │  │  250 PF  │  │  250 PF  │        │
│  │  43 PB/s │  │  43 PB/s │  │  43 PB/s │        │
│  └──────────┘  └──────────┘  └──────────┘        │
│                                                    │
│  ┌──────────────────────────────────────────────┐ │
│  │              Power Shelves                    │ │
│  │        120-140 kW 总功率                      │ │
│  └──────────────────────────────────────────────┘ │
│                                                    │
│  2D Torus Mesh — 2μs wafer-to-wafer latency        │
│  RoCE v2 Ethernet — 标准数据中心集成                │
└───────────────────────────────────────────────────┘
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;每个 Backpack 是一颗 WSE-3T 加上供电、液冷、I/O 和控制电路，垂直插在机架背面。一个 CS-4 机架插三个，总算力 &lt;strong&gt;750 PFLOPS&lt;/strong&gt;，总内存带宽 &lt;strong&gt;129.6 PB/s&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;功耗当然也翻倍了——每个 Backpack 约 46 kW，整机 120-140 kW。但在今天的语境下，这个数字甚至显得「保守」：Nvidia 今年晚些时候的 NVL72 机架据说要 240-250 kW。&lt;/p&gt;
&lt;h3 id=&#34;解耦推理aws-和-amd-做前菜cerebras-做主菜&#34;&gt;解耦推理：AWS 和 AMD 做「前菜」，Cerebras 做「主菜」&lt;/h3&gt;
&lt;p&gt;这次 Cerebras 做了一个很有意思的架构调整。&lt;/p&gt;
&lt;p&gt;推理流程分两段：&lt;strong&gt;prefill&lt;/strong&gt;（提示词处理阶段，计算密集但无交互压力）和 &lt;strong&gt;decode&lt;/strong&gt;（逐 token 生成阶段，延迟敏感）。以前 Cerebras 什么都自己干，结果发现它的 SRAM 虽然大，但计算单元不足以在 prefill 阶段把 43.2 PB/s 的内存带宽用满。&lt;/p&gt;
&lt;p&gt;解决方案是&lt;strong&gt;解耦&lt;/strong&gt;：prefill 交给外部加速器，Cerebras 只做 decode。&lt;/p&gt;
&lt;p&gt;Cerebras 宣布了与 &lt;strong&gt;AWS&lt;/strong&gt;（Trainium XPU）和 &lt;strong&gt;AMD&lt;/strong&gt;（Instinct GPU）的合作，让它们的芯片做 prefill，把中间状态交给 Cerebras 做超低延迟 decode。这跟 Nvidia 在 LPX 机架里用 Groq LPU 做 decode 加速器的思路如出一辙——AI 推理正在变成「前处理 + 推理引擎」的分离架构，每家芯片都在找自己的生态位。&lt;/p&gt;
&lt;h3 id=&#34;direct-wafer-links2μs-延迟的秘密武器&#34;&gt;Direct Wafer Links：2μs 延迟的秘密武器&lt;/h3&gt;
&lt;p&gt;多芯片互联是集群推理的最大瓶颈。GPU 依赖 tensor parallelism 和 expert parallelism，需要极高的 interconnect 带宽——这也就是为什么 Nvidia 的 NVLink 和 InfiniBand 那么贵。&lt;/p&gt;
&lt;p&gt;Cerebras 走了另一条路：&lt;strong&gt;扔掉交换机&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;CS-4 的芯片之间用 &lt;strong&gt;Direct Wafer Links&lt;/strong&gt; 直连，形成一个 2D torus 网格。没有中间交换机，wafer-to-wafer 延迟从 5μs 降到 &lt;strong&gt;2μs&lt;/strong&gt;。Cerebras 说这个拓扑可以支撑&lt;strong&gt;超过 50 万亿参数&lt;/strong&gt;的模型。&lt;/p&gt;
&lt;p&gt;当然它也支持标准的 RoCE v2 RDMA over Ethernet，只是用交换机延迟会高一些。但重点是：当你的芯片本身已经够快（43.2 PB/s 内存带宽），你就用不上那些复杂的并行策略了——pipeline parallelism 就够了，而 pipeline 最需要的就是低延迟互联。&lt;/p&gt;
&lt;p&gt;这个哲学跟 AWS Trainium3 的 mesh-to-switch 演进正好相反。AWS 是从直连转向交换网络，Cerebras 是从交换转向直连。两种不同的芯片规模、不同的并行策略、不同的取舍。&lt;/p&gt;
&lt;h3 id=&#34;写在最后&#34;&gt;写在最后&lt;/h3&gt;
&lt;p&gt;Cerebras CS-4 对我来说最有趣的一点，不是 4,400 tokens/s 这个数字本身，而是它代表的 &lt;strong&gt;AI 芯片竞争逻辑的变化&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;两年前大家还在比「谁的芯片算力最强」，现在比的已经是「谁的推理架构最有效率」。Nvidia 推 NVL72 机架、AMD 推 Helios、Cerebras 推 Nexus——三家都在从单芯片竞争转向机架级系统竞争。更关键的是，解耦推理的出现意味着&lt;strong&gt;未来没有一家芯片能包揽整个推理流程&lt;/strong&gt;——prefill 和 decode 会被不同的硬件处理，生态合作比单打独斗更重要。&lt;/p&gt;
&lt;p&gt;Cerebras 有一个独特的优势：44 GB 的片上 SRAM。跑一个万亿参数模型，别人需要上千颗 GPU 凑 HBM 带宽，Cerebras 只需要几十颗晶圆。OpenAI 已经签了 750 MW 的 Cerebras 推理部署合同——市场在用脚投票。&lt;/p&gt;
&lt;p&gt;当然，风险也很清楚：TSMC 5nm 制程已经用了三代（WSE-2 / WSE-3 / WSE-3T），SRAM 容量五年没涨。下一代 WSE-4 必须解决制程升级和 SRAM 扩容的问题，否则 Turbo 策略会碰到天花板。&lt;/p&gt;
&lt;p&gt;但至少在 2026 年这个节点，Cerebras 证明了：&lt;strong&gt;做一块盘子大的芯片，然后拼命给它供电——这个看似疯狂的方向，正在成为 AI 推理的一条重要路径&lt;/strong&gt;。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;📌 延伸阅读：之前写过 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260818-nvidia-wall-street-500b-ai-infrastructure/&#34; &gt;《Nvidia 组建华尔街天团募集 $5000 亿！AI 算力工厂从「买设备」变成「建基础设施」》&lt;/a&gt; — Nvidia 的资本运作 vs Cerebras 的技术路线，两条完全不同的 AI 基础设施竞争逻辑。&lt;/p&gt;&lt;/blockquote&gt;
</description>
        </item>
        
    </channel>
</rss>
