<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Helios on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/helios/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Fri, 24 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/helios/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>AMD 和 Cerebras 拆解 AI 推理！5x 能效比的解耦架构，Agent 时代的推理范式要变了！</title>
        <link>https://www.yesmiracle.net/post/20260724-amd-cerebras-disaggregated-inference/</link>
        <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260724-amd-cerebras-disaggregated-inference/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260724-amd-cerebras-disaggregated-inference/cover.svg" alt="Featured image of post AMD 和 Cerebras 拆解 AI 推理！5x 能效比的解耦架构，Agent 时代的推理范式要变了！" /&gt;&lt;p&gt;如果你关注 AI 推理市场，昨天 AMD 在 San Francisco 的 Advancing AI 2026 上放了一个大招——不是单纯的产品发布，而是一次架构思路的转向。&lt;/p&gt;
&lt;p&gt;AMD 和 Cerebras 宣布联合推出一套**解耦推理（disaggregated inference）**方案：把 AI 推理拆成两个截然不同的阶段，分别交给两套截然不同的硬件来处理。AMD Helios 机架负责 Prompt 处理和大上下文窗口，Cerebras 的 Wafer-Scale Engine（WSE）负责 Token 生成。&lt;/p&gt;
&lt;p&gt;联合方案声称，相比 Cerebras 仅用 WSE 的配置，能效比（T/s/W）提升最高 &lt;strong&gt;5 倍&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这不是一个简单的「我们合作了」新闻。它背后折射的是整个 AI 推理市场正在发生的一个根本性变化——推理不再是一个单一 workload，而是两个截然不同的 workload，需要两种截然不同的硬件来服务。&lt;/p&gt;
&lt;p&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260723-amd-anthropic-5b-partnership/&#34; &gt;《AMD 打响反击战！$50 亿投资 Anthropic，2GW MI450 集群要变天了！》&lt;/a&gt; 我们刚聊过 AMD 在资本层面的布局，今天这篇，我们深入到技术架构层面，看看 AMD 在推理基础设施上的真正野心。&lt;/p&gt;
&lt;h3 id=&#34;推理不是一件事是两件事&#34;&gt;推理不是一件事，是两件事&lt;/h3&gt;
&lt;p&gt;这句话听起来简单，但整个行业花了一整年才真正理解它的含义。&lt;/p&gt;
&lt;p&gt;服务一个大语言模型，实际上包含两个阶段：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第一阶段：Pre-fill（预填充）&lt;/strong&gt;
你输入的 Prompt——系统指令、检索回的文档、Tool 输出、对话历史——全部一起喂给模型。这个阶段是密集的矩阵乘法，在整个输入上同时计算。它饱和计算单元，规模随输入长度线性增长。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第二阶段：Decode（解码）&lt;/strong&gt;
模型逐 Token 生成回答。每个新 Token 都需要重新读取模型权重和累积的 KV Cache。几乎没什么新算术发生——机器的时间全花在搬数据上。&lt;/p&gt;
&lt;p&gt;这两个阶段对硬件的需求截然相反：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th&gt;Pre-fill（预填充）&lt;/th&gt;
          &lt;th&gt;Decode（解码）&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;瓶颈&lt;/td&gt;
          &lt;td&gt;计算能力（FLOPS）&lt;/td&gt;
          &lt;td&gt;内存带宽（GB/s）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;并行度&lt;/td&gt;
          &lt;td&gt;高（可同时处理整个输入）&lt;/td&gt;
          &lt;td&gt;低（逐 Token 串行）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;延时敏感度&lt;/td&gt;
          &lt;td&gt;低（用户容忍 1-3 秒）&lt;/td&gt;
          &lt;td&gt;极高（每 Token 50ms 就卡）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;硬件需求&lt;/td&gt;
          &lt;td&gt;大量 GPU 做密集矩阵乘法&lt;/td&gt;
          &lt;td&gt;巨大片上 SRAM 做快速数据搬运&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Cerebras 的 WSE 恰好是后者的天选之子——把权重放在巨大的片上 SRAM 中，绕过了传统 GPU 面临的内存带宽墙。但它的短板在于前者的规模化处理能力。&lt;/p&gt;
&lt;p&gt;AMD 的 Helios 机架恰好补上了这个短板。&lt;/p&gt;
&lt;h3 id=&#34;helios--wse一个推理引擎两套架构&#34;&gt;Helios + WSE：一个推理引擎，两套架构&lt;/h3&gt;
&lt;p&gt;这套联合方案的具体分工是这样的：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;AMD Helios 机架&lt;/strong&gt;负责 Pre-fill 阶段。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;72 颗 Instinct MI455X GPU&lt;/li&gt;
&lt;li&gt;约 2.9 ExaFLOPS FP4 算力&lt;/li&gt;
&lt;li&gt;31 TB HBM4 内存&lt;/li&gt;
&lt;li&gt;UALink over Ethernet 互联，聚合带宽 260 TB/s&lt;/li&gt;
&lt;li&gt;单机架定价 $5-5.5M&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;Cerebras WSE&lt;/strong&gt; 负责 Decode 阶段。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;晶圆级芯片，单芯片面积是传统 GPU 的 50 倍以上&lt;/li&gt;
&lt;li&gt;巨大片上 SRAM，避免内存带宽瓶颈&lt;/li&gt;
&lt;li&gt;业界最快的单设备推理引擎&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;两个引擎通过一条集成工作流连接。数据在 Pre-fill 阶段完成后，KV Cache 被传输到 WSE，然后 WSE 以极低延迟逐 Token 生成输出。&lt;/p&gt;
&lt;p&gt;用 Lisa Su 的话说：「AI 推理正成为 AI 中最大的基础设施机会，它的多样性需要更灵活的方法。AMD Helios 在最广泛的推理工作负载上提供领先性能和规模。与 Cerebras 合作，我们正在将这一领导力扩展到最延迟敏感的应用中，为实时 Agentic AI 创建一个强大的新平台。」&lt;/p&gt;
&lt;h3 id=&#34;5x-能效比数字背后的真实故事&#34;&gt;5x 能效比：数字背后的真实故事&lt;/h3&gt;
&lt;p&gt;联合方案声称 &lt;strong&gt;5x 更高的 T/s/W&lt;/strong&gt;（Tokens per Second per Watt）。但这个数字的脚注值得仔细看。&lt;/p&gt;
&lt;p&gt;TECHi 的报道一针见血地指出：「读脚注，不要只看标题数字。」&lt;/p&gt;
&lt;p&gt;这个 5x 的对比基准是 &lt;strong&gt;Cerebras WSE-only 配置&lt;/strong&gt;，不是 Nvidia，不是单独 AMD 机架，不是你正在生产环境中跑的任意配置。对比模型是 Kimi 2.6 1T，在同等交互性（interactivity）点上测的，且结果是&lt;strong&gt;建模数据，非实测基准&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;但这不是虚假宣传——两家公司都清晰地披露了基准条件，这比很多 AI 基础设施营销做得好。真正重要的是：&lt;strong&gt;这 5x 不是来自某个单一的硬件突破，而是来自架构级别的优化——把两个阶段的 workload 分别交给最适合它的硬件来处理。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;对于 Agent 工作负载来说，这点尤其关键。Agent 的推理模式与传统聊天截然不同：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Tool call 链&lt;/strong&gt;：短 Prompt + 多次 Tool 调用 → 需要极低延迟的 Token 生成&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;长上下文推理&lt;/strong&gt;：大量文档检索 + 深度分析 → 需要巨大的 Pre-fill 吞吐&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Realtime Agent&lt;/strong&gt;：用户等待响应，Agent 在后台做多步推理 → 每步延迟都关乎用户体验&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;解耦架构恰好同时满足了这些需求。&lt;/p&gt;
&lt;h3 id=&#34;这场合作意味着什么&#34;&gt;这场合作意味着什么？&lt;/h3&gt;
&lt;p&gt;从战略角度看，这笔合作对双方都是「补短板」：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;对 Cerebras 而言&lt;/strong&gt;：WSE 的 Token 生成能力世界一流，但缺少一个高性能的 Prompt 处理前端。AMD Helios 补上了这个缺口。Cerebras 将在其数据中心部署 Helios 系统，联合方案通过 Cerebras Cloud 在 2026 下半年提供。这意味着 Cerebras 从「卖芯片」变成了「卖推理服务」——这是更高价值的位置。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;对 AMD 而言&lt;/strong&gt;：Helios 机架多了一个重要的销售渠道。而且这次合作是 AMD 开放标准策略的又一次验证——Helios 基于 OCP Open Rack Wide、UALink 和 Ultra Ethernet Consortium 规范构建，不是封闭生态。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;对市场而言&lt;/strong&gt;：这是在「Nvidia vs everyone」的二元叙事之外，开辟了一条新的竞争路径。OpenAI 和 Meta 已经合计拥有 12GW 的 AMD 加速器容量，微软 Azure 和 Oracle 是 Helios 的早期客户，现在 Cerebras 也加入了。&lt;/p&gt;
&lt;p&gt;AMD 的股价今年已经翻倍，分析师目标价在 $600-700 区间。Cerebras 上市后（CBRS）也在此次消息后上涨约 4%。&lt;/p&gt;
&lt;h3 id=&#34;写在最后&#34;&gt;写在最后&lt;/h3&gt;
&lt;p&gt;解耦推理并不是一个新概念——学术界和系统研究者讨论它已经有一段时间了。但 AMD 和 Cerebras 的这次合作，是第一次有两大硬件厂商在商用层面把它落地。&lt;/p&gt;
&lt;p&gt;这让我想起 2018 年左右的 CPU+GPU 异构计算演变——当时大家也在争论「GPU 会不会取代 CPU」，最终发现答案是「两者各司其职」。今天的推理市场正在经历类似的演变，只是这次的主角换成了 Pre-fill 和 Decode 两个阶段。&lt;/p&gt;
&lt;p&gt;对于正在构建 Agent 系统的团队来说，这个趋势值得关注。当推理基础设施从「一块大 GPU 做所有事」走向「专业化组件各干各的」，你的延迟、成本和吞吐量都会被重新定义。&lt;/p&gt;
&lt;p&gt;2026 下半年，Cerebras Cloud 上见。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;em&gt;本文参考了 AMD 官方新闻稿、MLQ 技术分析及 TECHi 的深度报道。&lt;/em&gt;&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
