<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>SemiAnalysis on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/semianalysis/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Tue, 15 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/semianalysis/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>NVIDIA Vera Rubin NVL72 实测碾压 Blackwell！SemiAnalysis 偷跑数据：30x 效率、7x 能效、Jensen 又保守了！</title>
        <link>https://www.yesmiracle.net/post/20260915-nvidia-vera-rubin-nvl72-benchmark/</link>
        <pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260915-nvidia-vera-rubin-nvl72-benchmark/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260915-nvidia-vera-rubin-nvl72-benchmark/cover.svg" alt="Featured image of post NVIDIA Vera Rubin NVL72 实测碾压 Blackwell！SemiAnalysis 偷跑数据：30x 效率、7x 能效、Jensen 又保守了！" /&gt;&lt;p&gt;你肯定还记得今年 GTC 2026 上 Jensen Huang 那个标志性的 leather jacket 演讲。&lt;/p&gt;
&lt;p&gt;当时他放了一张图，说 Vera Rubin NVL72 在 1-3 万亿参数模型上「每兆瓦性能是 Blackwell 的 3 倍」。台下掌声雷动，但如果你也在芯片圈混过几年，你一定听出那个「3x」背后的保留语气。&lt;/p&gt;
&lt;p&gt;果然。昨天 SemiAnalysis 发布了&lt;strong&gt;第一份 Vera Rubin NVL72 实测 AgentX 基准结果&lt;/strong&gt;——在真实 Agentic AI 推理负载下，Rubin 的每兆瓦吞吐量&lt;strong&gt;最高达到 Blackwell 的 30 倍&lt;/strong&gt;。而在 Jensen 引用的 200 TPS 指标点，实测结果是 &lt;strong&gt;7x，不是 3x&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这不是第一次了。上一轮 GB200 NVL72 发布时，Jensen 说「30x Hopper」，SemiAnalysis 测出来是「98x Hopper」。这哥们不是在吹牛，他是在刻意压数据——在芯片行业这叫「sandbagging」，目的是给合作伙伴留面子、给自己留余量。&lt;/p&gt;
&lt;p&gt;但这次的数据实在压不住了。&lt;/p&gt;
&lt;h2 id=&#34;semianalysis-agentx第一个为-agentic-ai-设计的基准&#34;&gt;SemiAnalysis AgentX：第一个为 Agentic AI 设计的基准&lt;/h2&gt;
&lt;p&gt;要理解为什么 Rubin 的数据这么炸，先得说清楚 AgentX 是什么。&lt;/p&gt;
&lt;p&gt;传统 GPU 基准测的是「固定序列长度」——输入 8K tokens、输出 1K tokens，一个批次跑完看吞吐量。但真实世界里，&lt;strong&gt;Agentic AI 的工作负载根本不是这样&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;多轮对话&lt;/strong&gt;：一次 Agent 会话可能包含几十到几百次模型调用&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;长上下文&lt;/strong&gt;：系统提示、工具定义、历史对话让 context 快速累积到几十万 token&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;高前缀复用&lt;/strong&gt;：KV cache 可以缓存已处理过的上下文，不需要重复计算&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Sub-agent 突发&lt;/strong&gt;：每次启动子 Agent 都会产生新的 KV cache 突发模式&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;OpenRouter 的 State of AI 报告显示，&lt;strong&gt;单个 Agentic 请求消耗的 token 是普通聊天的 15 倍&lt;/strong&gt;。用固定序列长度去测 Agentic 推理的硬件性能，就像用 F1 赛道的单圈时间来衡量一辆卡车在山路上的货运效率——测的是个寂寞。&lt;/p&gt;
&lt;p&gt;AgentX 正是为此而生。它回放真实 Claude Code 会话的完整轨迹——推理时间、工具调用间隙、KV cache 压力全部保留——然后测每个系统在&lt;strong&gt;相同的真实流量模式&lt;/strong&gt;下的每兆瓦吞吐量和用户交互体验。&lt;/p&gt;
&lt;p&gt;SemiAnalysis 说，这个基准已经被 Google Cloud、Microsoft Azure、Oracle、Meta 以及 OpenAI、MiniMax、Qwen、Moonshot Kimi 等主流实验室验证或采用。vLLM、SGLang、PyTorch、HuggingFace 也都支持。&lt;/p&gt;
&lt;h2 id=&#34;数字说话rubin-到底强了多少&#34;&gt;数字说话：Rubin 到底强了多少？&lt;/h2&gt;
&lt;p&gt;先看这张核心对比表（AgentX 基准，DeepSeek V4 Pro 1.6T 模型）：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;指标&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Vera Rubin NVL72&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;GB300 NVL72 (SGLang)&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;H200 NVL8&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;100 TPS 吞吐量 (M tok/s/MW)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;59.4&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;28.5&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~4&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;80 TPS P90 性价比 (x H200)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;~67x&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~18x&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1x (基准)&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;120 TPS P90 性价比 (x H200)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;~39x&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;160 TPS 每兆瓦吞吐量提升 (vs GB300)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;30x&lt;/strong&gt; (宣称)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1x&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;每兆瓦年化利润 (模型)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$149.9B&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$105.3B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;每百万 token 成本 (vs GB300)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;1/35&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1x&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这组数字的冲击力在于——&lt;strong&gt;它不是 NVIDIA 自己的实验室数据，这是 SemiAnalysis 用第三方基准在自己集群上实测出来的&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;在 100 TPS 交互性目标下，Rubin 达到 59.4M tokens/sec/MW，是 GB300 SGLang 28.5M 的 &lt;strong&gt;2.09x&lt;/strong&gt;。在 80 TPS P90 目标下，性价比达到了 H200 的 &lt;strong&gt;67 倍&lt;/strong&gt;——注意这是个跨代对比，但足以说明 Rubin 的架构飞跃。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;为什么「性价比」在低 TPS 时更高？因为 TPS 要求越低，系统越容易利用 KV cache 和批处理来降低成本。Rubin 在这方面做了极端优化。&lt;/p&gt;&lt;/blockquote&gt;
&lt;h2 id=&#34;jensen-又sandbag了这次是-3x-vs-7x&#34;&gt;Jensen 又「Sandbag」了——这次是 3x vs 7x&lt;/h2&gt;
&lt;p&gt;SemiAnalysis 的文章标题直接写「Jensen Sandbagging Performance Again」。&lt;/p&gt;
&lt;p&gt;在 GTC 2026 上，Jensen 展示的图表显示 VR NVL72 在约 200 TPS 时比 Blackwell 好 3x。但 SemiAnalysis 在预发布软件上的实测跑出了 &lt;strong&gt;7x 的 token 每兆瓦优势&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;为什么压数据？三个可能：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;给 Blackwell 留面子&lt;/strong&gt;——Rubin 发布时 Blackwell 还在大规模出货，NVIDIA 不想让客户觉得自己刚买的东西就过时了&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;给软件栈留余量&lt;/strong&gt;——预发布软件还没优化到位，正式发布时差距会更大，提前报高了以后没法交代&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;NVIDIA 的内部文化&lt;/strong&gt;——Jensen 在 GTC 上习惯性地「保守估计」，等第三方来打脸反而制造更多话题&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;不管原因是什么，这已经成一个模式了。GB200 NVL72 发布时同样如此——Jensen 说 30x Hopper，SemiAnalysis 测出 98x。&lt;/p&gt;
&lt;h2 id=&#34;rubin-的架构密码六芯片极限协同设计&#34;&gt;Rubin 的架构密码：六芯片极限协同设计&lt;/h2&gt;
&lt;p&gt;为什么 Rubin 能拉开这么大的差距？答案在架构。&lt;/p&gt;
&lt;p&gt;Rubin 是 NVIDIA 第一个为 Agentic AI 时代从头设计的平台。它不只是换了个 GPU，而是&lt;strong&gt;六个芯片的极限协同设计&lt;/strong&gt;：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;组件&lt;/th&gt;
          &lt;th&gt;角色&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;Rubin GPU&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;新一代加速器，288 GB HBM4，Tensor Core K-step 翻倍到 64 字节&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;Vera CPU&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;自研 ARM 架构 CPU，替代 Grace，管理 NVLink 和内存一致性&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;NVLink 6 Switch&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;第六代 NVLink，GPU 间带宽翻倍，支持 72 GPU 的共享内存空间&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;ConnectX-9&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;400G 网卡，网络带宽翻倍&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;BlueField-4&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;第四代 DPU，加速网络、存储、安全卸载&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;Spectrum-6&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;新一代以太网交换机，支持超大规模 AI 集群组网&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一台 NVL72 机架包含 72 颗 Rubin GPU + 36 颗 Vera CPU，通过 NVLink 6 组成共享内存空间，单机架提供 &lt;strong&gt;3.6 EFLOPS NVFP4 推理性能和 2.5 EFLOPS FP8 训练性能&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;Agentic workload 下的关键设计决策有两个：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;KV cache 容量大幅提升&lt;/strong&gt;——HBM4 288 GB/GPU + NVLink 6 的带宽让子 Agent 突发产生的 KV cache 压力不再是瓶颈&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;推理和训练的架构统一&lt;/strong&gt;——同一套系统既能跑训练也能跑推理，数据中心的利用率不会出现「训练时满载、推理时空转」的波峰波谷&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id=&#34;不只是-papercoreweave-和-nebius-已经上线了&#34;&gt;不只是 Paper：CoreWeave 和 Nebius 已经上线了&lt;/h2&gt;
&lt;p&gt;这篇文章最可怕的是——这些数字不是来自「明年才能买的样品」。&lt;/p&gt;
&lt;p&gt;CoreWeave 已经宣布将 Vera Rubin NVL72 投入生产，实测&lt;strong&gt;10x token 每兆瓦推理性能提升&lt;/strong&gt;。Nebius 也在芬兰数据中心上线了第一台 Ruby NVL72 机架，声称自己是最早达到这一里程碑的 AI 云提供商之一。&lt;/p&gt;
&lt;p&gt;NVIDIA 说 Rubin 在 2026 年 Q1 进入批量生产，H2 开始向超大规模云和 Neocloud 出货。也就是说，&lt;strong&gt;现在已经在跑了&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;SemiAnalysis 的结论更有意思：「随着 Rubin 的软件栈和 kernel 库成熟，以及开发者社区积累针对 Rubin 的优化经验，我们预计差距还会拉大。」&lt;/p&gt;
&lt;p&gt;换句话说，59.4M tok/s/MW 还不是上限——这只是预发布软件的水平。&lt;/p&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;
&lt;p&gt;Vera Rubin 的数据让我想起 2023 年 H100 刚出货时的情景——大家还沉浸在「Ampere 够用」的错觉里，直到实测跑分出来才发现翻了几倍。&lt;/p&gt;
&lt;p&gt;这次不同的是三点：&lt;/p&gt;
&lt;p&gt;第一，&lt;strong&gt;Agentic AI 的工作负载模式已经完全不同&lt;/strong&gt;。如果你还在用 8K/1K 固定序列去评估 GPU，你根本不知道自己的数据中心效率有多低。AgentX 不是可有可无的基准，它应该成为你采购决策的第一张表。&lt;/p&gt;
&lt;p&gt;第二，&lt;strong&gt;规模效应的第二曲线正在打开&lt;/strong&gt;。SemiAnalysis 给出了 Rubin 每 GW 年化 $149.9B 利润的模型——这不仅仅是「更快的 GPU」，这是一台可以自己还贷的印钞机。「买得越多、赚得越多」（The More You Buy, The More You Earn）从营销口号变成了真实的经济学命题。&lt;/p&gt;
&lt;p&gt;第三，&lt;strong&gt;Jensen 的「Sandbag」已经是行业级 meme&lt;/strong&gt;，但背后有个严肃的问题：当 NVIDIA 的实测数据比官方宣称高出 2-7 倍，你作为采购方应该信谁的？答案很明确——等第三方实测，不要只看 GTC 的 Keynote。&lt;/p&gt;
&lt;p&gt;数据中心的每一兆瓦都是真金白银。Rubin 的 59.4M vs Blackwell 的 28.5M——这个差距值得你做一次采购策略的重审。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;📊 数据来源：SemiAnalysis「Vera Rubin NVL72 Agentic Inference: 67x better Performance per Dollar」、NVIDIA Developer Blog「Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt」、OpenRouter State of AI Report、CoreWeave 生产级验证&lt;/p&gt;&lt;/blockquote&gt;</description>
        </item>
        
    </channel>
</rss>
