如果你关注 AI 推理市场,昨天 AMD 在 San Francisco 的 Advancing AI 2026 上放了一个大招——不是单纯的产品发布,而是一次架构思路的转向。
AMD 和 Cerebras 宣布联合推出一套**解耦推理(disaggregated inference)**方案:把 AI 推理拆成两个截然不同的阶段,分别交给两套截然不同的硬件来处理。AMD Helios 机架负责 Prompt 处理和大上下文窗口,Cerebras 的 Wafer-Scale Engine(WSE)负责 Token 生成。
联合方案声称,相比 Cerebras 仅用 WSE 的配置,能效比(T/s/W)提升最高 5 倍。
这不是一个简单的「我们合作了」新闻。它背后折射的是整个 AI 推理市场正在发生的一个根本性变化——推理不再是一个单一 workload,而是两个截然不同的 workload,需要两种截然不同的硬件来服务。
《AMD 打响反击战!$50 亿投资 Anthropic,2GW MI450 集群要变天了!》 我们刚聊过 AMD 在资本层面的布局,今天这篇,我们深入到技术架构层面,看看 AMD 在推理基础设施上的真正野心。
推理不是一件事,是两件事
这句话听起来简单,但整个行业花了一整年才真正理解它的含义。
服务一个大语言模型,实际上包含两个阶段:
第一阶段:Pre-fill(预填充) 你输入的 Prompt——系统指令、检索回的文档、Tool 输出、对话历史——全部一起喂给模型。这个阶段是密集的矩阵乘法,在整个输入上同时计算。它饱和计算单元,规模随输入长度线性增长。
第二阶段:Decode(解码) 模型逐 Token 生成回答。每个新 Token 都需要重新读取模型权重和累积的 KV Cache。几乎没什么新算术发生——机器的时间全花在搬数据上。
这两个阶段对硬件的需求截然相反:
| 维度 | Pre-fill(预填充) | Decode(解码) |
|---|---|---|
| 瓶颈 | 计算能力(FLOPS) | 内存带宽(GB/s) |
| 并行度 | 高(可同时处理整个输入) | 低(逐 Token 串行) |
| 延时敏感度 | 低(用户容忍 1-3 秒) | 极高(每 Token 50ms 就卡) |
| 硬件需求 | 大量 GPU 做密集矩阵乘法 | 巨大片上 SRAM 做快速数据搬运 |
Cerebras 的 WSE 恰好是后者的天选之子——把权重放在巨大的片上 SRAM 中,绕过了传统 GPU 面临的内存带宽墙。但它的短板在于前者的规模化处理能力。
AMD 的 Helios 机架恰好补上了这个短板。
Helios + WSE:一个推理引擎,两套架构
这套联合方案的具体分工是这样的:
AMD Helios 机架负责 Pre-fill 阶段。
- 72 颗 Instinct MI455X GPU
- 约 2.9 ExaFLOPS FP4 算力
- 31 TB HBM4 内存
- UALink over Ethernet 互联,聚合带宽 260 TB/s
- 单机架定价 $5-5.5M
Cerebras WSE 负责 Decode 阶段。
- 晶圆级芯片,单芯片面积是传统 GPU 的 50 倍以上
- 巨大片上 SRAM,避免内存带宽瓶颈
- 业界最快的单设备推理引擎
两个引擎通过一条集成工作流连接。数据在 Pre-fill 阶段完成后,KV Cache 被传输到 WSE,然后 WSE 以极低延迟逐 Token 生成输出。
用 Lisa Su 的话说:「AI 推理正成为 AI 中最大的基础设施机会,它的多样性需要更灵活的方法。AMD Helios 在最广泛的推理工作负载上提供领先性能和规模。与 Cerebras 合作,我们正在将这一领导力扩展到最延迟敏感的应用中,为实时 Agentic AI 创建一个强大的新平台。」
5x 能效比:数字背后的真实故事
联合方案声称 5x 更高的 T/s/W(Tokens per Second per Watt)。但这个数字的脚注值得仔细看。
TECHi 的报道一针见血地指出:「读脚注,不要只看标题数字。」
这个 5x 的对比基准是 Cerebras WSE-only 配置,不是 Nvidia,不是单独 AMD 机架,不是你正在生产环境中跑的任意配置。对比模型是 Kimi 2.6 1T,在同等交互性(interactivity)点上测的,且结果是建模数据,非实测基准。
但这不是虚假宣传——两家公司都清晰地披露了基准条件,这比很多 AI 基础设施营销做得好。真正重要的是:这 5x 不是来自某个单一的硬件突破,而是来自架构级别的优化——把两个阶段的 workload 分别交给最适合它的硬件来处理。
对于 Agent 工作负载来说,这点尤其关键。Agent 的推理模式与传统聊天截然不同:
- Tool call 链:短 Prompt + 多次 Tool 调用 → 需要极低延迟的 Token 生成
- 长上下文推理:大量文档检索 + 深度分析 → 需要巨大的 Pre-fill 吞吐
- Realtime Agent:用户等待响应,Agent 在后台做多步推理 → 每步延迟都关乎用户体验
解耦架构恰好同时满足了这些需求。
这场合作意味着什么?
从战略角度看,这笔合作对双方都是「补短板」:
对 Cerebras 而言:WSE 的 Token 生成能力世界一流,但缺少一个高性能的 Prompt 处理前端。AMD Helios 补上了这个缺口。Cerebras 将在其数据中心部署 Helios 系统,联合方案通过 Cerebras Cloud 在 2026 下半年提供。这意味着 Cerebras 从「卖芯片」变成了「卖推理服务」——这是更高价值的位置。
对 AMD 而言:Helios 机架多了一个重要的销售渠道。而且这次合作是 AMD 开放标准策略的又一次验证——Helios 基于 OCP Open Rack Wide、UALink 和 Ultra Ethernet Consortium 规范构建,不是封闭生态。
对市场而言:这是在「Nvidia vs everyone」的二元叙事之外,开辟了一条新的竞争路径。OpenAI 和 Meta 已经合计拥有 12GW 的 AMD 加速器容量,微软 Azure 和 Oracle 是 Helios 的早期客户,现在 Cerebras 也加入了。
AMD 的股价今年已经翻倍,分析师目标价在 $600-700 区间。Cerebras 上市后(CBRS)也在此次消息后上涨约 4%。
写在最后
解耦推理并不是一个新概念——学术界和系统研究者讨论它已经有一段时间了。但 AMD 和 Cerebras 的这次合作,是第一次有两大硬件厂商在商用层面把它落地。
这让我想起 2018 年左右的 CPU+GPU 异构计算演变——当时大家也在争论「GPU 会不会取代 CPU」,最终发现答案是「两者各司其职」。今天的推理市场正在经历类似的演变,只是这次的主角换成了 Pre-fill 和 Decode 两个阶段。
对于正在构建 Agent 系统的团队来说,这个趋势值得关注。当推理基础设施从「一块大 GPU 做所有事」走向「专业化组件各干各的」,你的延迟、成本和吞吐量都会被重新定义。
2026 下半年,Cerebras Cloud 上见。
本文参考了 AMD 官方新闻稿、MLQ 技术分析及 TECHi 的深度报道。