<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Benchmark on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/benchmark/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Fri, 14 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/benchmark/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Grok 4.6 横空出世！500K 上下文 &#43; $2/百万 tokens，xAI 用后训练打了一场漂亮的性价比之战！</title>
        <link>https://www.yesmiracle.net/post/20260814-grok-4-6-launch-pricing-benchmarks/</link>
        <pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260814-grok-4-6-launch-pricing-benchmarks/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260814-grok-4-6-launch-pricing-benchmarks/cover.svg" alt="Featured image of post Grok 4.6 横空出世！500K 上下文 &#43; $2/百万 tokens，xAI 用后训练打了一场漂亮的性价比之战！" /&gt;&lt;h2 id=&#34;当不加价成为最大的卖点&#34;&gt;当「不加价」成为最大的卖点&lt;/h2&gt;
&lt;p&gt;如果你关注 AI 模型市场，昨天 xAI 扔下了一颗不大不小的炸弹。&lt;/p&gt;
&lt;p&gt;Grok 4.6，8 月 12 日正式发布——&lt;strong&gt;不涨价&lt;/strong&gt;。$2/百万输入、$6/百万输出的 API 价格纹丝不动。这在 2026 年的模型军备竞赛里，已经算得上良心定价了。&lt;/p&gt;
&lt;p&gt;但真正让开发者们兴奋的是那个数字：&lt;strong&gt;500,000 tokens 上下文窗口&lt;/strong&gt;。对比 Grok 4.5 的 1M 上下文实际上还缩了水？不，4.5 的 1M 标注是理论最大值，4.6 把有效可用上下文从 128K 直接拉到了 &lt;strong&gt;500K&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;还是先看价格对比表吧，数据说话最直接：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;模型&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;输入价格 ($/M tokens)&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;输出价格 ($/M tokens)&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;上下文&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;AA Index&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;Grok 4.6&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$2&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$6&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;500K&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;61&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Grok 4.5&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$2&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$6&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;128K 有效&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;56&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;GPT-5.6 Sol Max&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$2&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$6&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;61&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Fable 5 Max&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$5&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$15&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;62&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Claude Opus 5&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$15&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$75&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;200K&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;63&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Grok 4.6 以 Fable 5 的 &lt;strong&gt;1/3 输入价格、1/12 输出价格&lt;/strong&gt; 拿到了几乎同级的 AA Index。Claude Opus 5 仍然是智能王者，但价格是 Grok 4.6 的 &lt;strong&gt;12.5 倍&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;性价比这个词，2026 年终于不再是个营销话术了。&lt;/p&gt;
&lt;h2 id=&#34;500k-上下文和暗藏的定价悬崖&#34;&gt;500K 上下文和暗藏的「定价悬崖」&lt;/h2&gt;
&lt;p&gt;先说好的：&lt;strong&gt;500K 上下文&lt;/strong&gt;是实打实的升级。&lt;/p&gt;
&lt;p&gt;以前 Grok 4.5 虽然标称 1M，但实际上超过 128K 之后性能就开始衰减。4.6 把可靠窗口做到了 500K——你可以在一个 prompt 里塞进《三体》三部曲的全文还有富余，然后让模型直接回答问题。&lt;/p&gt;
&lt;p&gt;这给长距离 Agent 任务带来了质变。以 &lt;strong&gt;APEX-Agents&lt;/strong&gt; 为例，Grok 4.6 得分 &lt;strong&gt;57.5%&lt;/strong&gt;，比 4.5 的 47.1% 暴涨了 10.4 个百分点，甚至超过了 GPT-5.6 Sol Max 的 56.7%。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;但硬币有另一面。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;xAI 的定价表里藏着一个小字条款：&lt;strong&gt;prompt 一旦超过 200K tokens，整个请求的单价翻倍&lt;/strong&gt;——$4 输入 / $12 输出，而且是对全部 tokens，不仅仅是超出的部分。&lt;/p&gt;
&lt;p&gt;这叫什么？这叫「&lt;strong&gt;全量重定价&lt;/strong&gt;」。&lt;/p&gt;
&lt;p&gt;假设你做一个长文档分析项目，每个 prompt 240K tokens。理论上你该付 $0.48（240K × $2/M）。但实际上你要付 $0.96（240K × $4/M）——因为整个请求进了长上下文定价带。&lt;/p&gt;
&lt;p&gt;xAI 管这个叫 &amp;ldquo;fast variant&amp;rdquo;。我管它叫&lt;strong&gt;定价悬崖&lt;/strong&gt;——你在 200K 以内享受廉价推理，一超过阈值，成本瞬间翻倍。&lt;/p&gt;
&lt;p&gt;对比来看：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;场景&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Grok 4.6&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;GPT-5.6 Sol&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Fable 5&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;短 prompt (10K)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.02&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.02&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.05&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;中等 (100K)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.20&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.20&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.50&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;长 prompt (250K - 超阈值)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$1.00&lt;/strong&gt; ☠️&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.50&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$1.25&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以 Grok 4.6 的真正甜蜜点是 &lt;strong&gt;200K tokens 以内的场景&lt;/strong&gt;。在这个范围内，它的性价比无人能敌。&lt;/p&gt;
&lt;h2 id=&#34;benchmark-全面解读哪里赢了哪里输了&#34;&gt;Benchmark 全面解读：哪里赢了，哪里输了&lt;/h2&gt;
&lt;p&gt;xAI 这次放了一张 10 行的 benchmark 表，我们从工程视角逐行拆解。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;评测&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Grok 4.6&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Grok 4.5&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;GPT-5.6 Sol Max&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Fable 5 Max&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;AA Intelligence Index&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;61&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;56&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;61&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;62&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;CursorBench v3.2&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;69.9%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;66.7%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;67.2%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;70.5%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;DeepSWE v1.1&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;65.9%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;54.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;73.0%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;70.0%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;APEX-Agents&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;57.5%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;47.1%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;56.7%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;59.2%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;Terminal-Bench v3.0&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;15.7%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;34.6%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;34.1%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;FrontierCode v1.1&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;61.3%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;56.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;60.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;63.6%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;Harvey LAB (Vals)&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;15.8%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;12.9%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;2.5%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;11.3%&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Grok 4.6 的强项：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Agent 长任务（APEX-Agents）&lt;/strong&gt;：57.5%，在对比模型中最高，反超 Sol Max&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;法律知识工作（Harvey LAB）&lt;/strong&gt;：15.8%，碾压 Sol 的 2.5%——这是 xAI 刻意在 RL 阶段加入知识工程领域的结果&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GDPVal-AA v2&lt;/strong&gt;：1753，超过 Sol 的 1728&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;知识检索（AA-Briefcase）&lt;/strong&gt;：1577，同样领先&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;Grok 4.6 的短板：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;仓库级编码（DeepSWE v1.1）&lt;/strong&gt;：65.9%，被 Sol 的 73.0% 甩了 7 个百分点——这是 repo-scale 的纯编码任务，Sol 确实更强&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;终端操作（Terminal-Bench v3.0）&lt;/strong&gt;：26.0%，大幅落后 Sol 的 34.6%。注意 Terminal-Bench v3.0 是全新套件，没人超过 35%&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Cursor IDE 编码（CursorBench）&lt;/strong&gt;：69.9%，被 Fable 5 的 70.5% 微弱领先&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;一句话总结：&lt;strong&gt;Grok 4.6 在 Agent 长任务和知识工作上有独特优势，在仓库级编码上仍然不如 Sol。&lt;/strong&gt; 如果你主要用 IDE 里的 AI 助手写代码，Fable 5 仍然是王者；如果你在构建长周期 Agent 流程，Grok 4.6 值得一试。&lt;/p&gt;
&lt;h2 id=&#34;后训练驱动没有新架构全靠数据质量&#34;&gt;后训练驱动：没有新架构，全靠数据质量&lt;/h2&gt;
&lt;p&gt;这是 Grok 4.6 最反直觉的地方：&lt;strong&gt;它不是新模型。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;xAI 没有发布新预训练基座。Grok 4.6 是 Grok 4.5 基座拿出来做了「更长」的补充训练，然后叠了三层后训练：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;SFT 被 Grok 4.5 自己重写&lt;/strong&gt;：用 4.5 生成了新的监督微调轨迹，覆盖推理、Agent、STEM、软件工程。有问题的轨迹被模型本身过滤掉了。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Agentic RL&lt;/strong&gt;：在知识工作、通用编码、内核优化、Web 开发和 CAD 等领域做强化学习。注意 CAD 和内核优化——xAI 刻意让模型在「一步错代价高」的领域训练。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;更长的训练 + 改进的优化器&lt;/strong&gt;：比 4.5 更长的补充训练，加上新的优化器和训练配方。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这个「&lt;strong&gt;用上一个模型写下一个模型的作业&lt;/strong&gt;」模式已经成为全行业的标配了。xAI 把它做到了极致——训练数据、过滤规则、RL 环境，全都是内部迭代出来的。&lt;/p&gt;
&lt;p&gt;有意思的是，xAI 还提到 4.6 开始展现出 &lt;strong&gt;self-testing&lt;/strong&gt; 行为——模型在执行长轨迹时会自己检查自己的输出，在继续之前先验证。这在官方公告里只是一句话，但对于跑过 Agent 工作流的开发者来说，这是最容易共鸣的改进。&lt;/p&gt;
&lt;h2 id=&#34;生态布局cursor--grok-build--全平台覆盖&#34;&gt;生态布局：Cursor + Grok Build + 全平台覆盖&lt;/h2&gt;
&lt;p&gt;Grok 4.6 发布首日就上了这些平台：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;xAI API&lt;/strong&gt;：grok-4.6 模型 ID，即刻可用&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Cursor&lt;/strong&gt;：首周双倍用量&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Grok Build&lt;/strong&gt;：xAI 自家 Agent 框架&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;OpenRouter&lt;/strong&gt;：第三方聚合&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Vercel&lt;/strong&gt;：Edge 部署&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Cloudflare&lt;/strong&gt;：全球边缘推理&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;从 Cursor 的收购到 Grok Build 的开源，xAI 的策略很清楚：&lt;strong&gt;不做封闭生态&lt;/strong&gt;。模型给你、框架给你、部署平台也给你。盈利靠 API 调用量，不靠锁定。&lt;/p&gt;
&lt;p&gt;首周促销是 2x 用量——和 Grok 4.5 发布时一样的策略。如果你当时没用完双倍，这次是新的双倍窗口。&lt;/p&gt;
&lt;p&gt;至于已经在路上的 &lt;strong&gt;Grok 4.7&lt;/strong&gt;，xAI 透露是基于 2.1T 参数架构的全面升级（非后训练），预计几周内发布。所以 4.6 更像是一个「中场更新」——用后训练榨干 4.5 基座的最后一滴潜力，给 4.7 争取时间。&lt;/p&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;
&lt;p&gt;Grok 4.6 是一款定位精准的产品：&lt;strong&gt;不追求全面领先，追求单位成本的智能密度。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;它的 benchmark 不是最漂亮的——DeepSWE 73% 和 Terminal-Bench 34.6% 仍然是 Sol 的地盘。但如果你算一笔账：$2/$6 的价格拿到 AA Index 61 的智能水平，在 200K 以内的 prompt 长度下，Grok 4.6 是当前市场上&lt;strong&gt;性价比最高的前沿模型&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;2026 年的模型市场已经分化为两个阵营：一边是「贵但最强」的 Opus 5 和 Fable 5，另一边是「够用且便宜」的 Grok 4.6 和 DeepSeek V4。对于大多数工程场景——代码生成、文档分析、Agent 工作流——后者可能才是更理性的选择。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;📌 相关阅读：&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260813-coreweave-q2-revenue-doubles/&#34; &gt;CoreWeave Q2 营收翻倍至 $25.8 亿！$1040 亿积压订单 + 大客户矩阵，AI 云基础设施的疯狂造富时代！&lt;/a&gt;&lt;/p&gt;&lt;/blockquote&gt;
</description>
        </item>
        
    </channel>
</rss>
