Featured image of post Grok 4.6 横空出世!500K 上下文 + $2/百万 tokens,xAI 用后训练打了一场漂亮的性价比之战!

Grok 4.6 横空出世!500K 上下文 + $2/百万 tokens,xAI 用后训练打了一场漂亮的性价比之战!

当「不加价」成为最大的卖点

如果你关注 AI 模型市场,昨天 xAI 扔下了一颗不大不小的炸弹。

Grok 4.6,8 月 12 日正式发布——不涨价。$2/百万输入、$6/百万输出的 API 价格纹丝不动。这在 2026 年的模型军备竞赛里,已经算得上良心定价了。

但真正让开发者们兴奋的是那个数字:500,000 tokens 上下文窗口。对比 Grok 4.5 的 1M 上下文实际上还缩了水?不,4.5 的 1M 标注是理论最大值,4.6 把有效可用上下文从 128K 直接拉到了 500K

还是先看价格对比表吧,数据说话最直接:

模型 输入价格 ($/M tokens) 输出价格 ($/M tokens) 上下文 AA Index
Grok 4.6 $2 $6 500K 61
Grok 4.5 $2 $6 128K 有效 56
GPT-5.6 Sol Max $2 $6 1M 61
Fable 5 Max $5 $15 1M 62
Claude Opus 5 $15 $75 200K 63

Grok 4.6 以 Fable 5 的 1/3 输入价格、1/12 输出价格 拿到了几乎同级的 AA Index。Claude Opus 5 仍然是智能王者,但价格是 Grok 4.6 的 12.5 倍

性价比这个词,2026 年终于不再是个营销话术了。

500K 上下文和暗藏的「定价悬崖」

先说好的:500K 上下文是实打实的升级。

以前 Grok 4.5 虽然标称 1M,但实际上超过 128K 之后性能就开始衰减。4.6 把可靠窗口做到了 500K——你可以在一个 prompt 里塞进《三体》三部曲的全文还有富余,然后让模型直接回答问题。

这给长距离 Agent 任务带来了质变。以 APEX-Agents 为例,Grok 4.6 得分 57.5%,比 4.5 的 47.1% 暴涨了 10.4 个百分点,甚至超过了 GPT-5.6 Sol Max 的 56.7%。

但硬币有另一面。

xAI 的定价表里藏着一个小字条款:prompt 一旦超过 200K tokens,整个请求的单价翻倍——$4 输入 / $12 输出,而且是对全部 tokens,不仅仅是超出的部分。

这叫什么?这叫「全量重定价」。

假设你做一个长文档分析项目,每个 prompt 240K tokens。理论上你该付 $0.48(240K × $2/M)。但实际上你要付 $0.96(240K × $4/M)——因为整个请求进了长上下文定价带。

xAI 管这个叫 “fast variant”。我管它叫定价悬崖——你在 200K 以内享受廉价推理,一超过阈值,成本瞬间翻倍。

对比来看:

场景 Grok 4.6 GPT-5.6 Sol Fable 5
短 prompt (10K) $0.02 $0.02 $0.05
中等 (100K) $0.20 $0.20 $0.50
长 prompt (250K - 超阈值) $1.00 ☠️ $0.50 $1.25

所以 Grok 4.6 的真正甜蜜点是 200K tokens 以内的场景。在这个范围内,它的性价比无人能敌。

Benchmark 全面解读:哪里赢了,哪里输了

xAI 这次放了一张 10 行的 benchmark 表,我们从工程视角逐行拆解。

评测 Grok 4.6 Grok 4.5 GPT-5.6 Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54.0% 73.0% 70.0%
APEX-Agents 57.5% 47.1% 56.7% 59.2%
Terminal-Bench v3.0 26.0% 15.7% 34.6% 34.1%
FrontierCode v1.1 61.3% 56.6% 60.6% 63.6%
Harvey LAB (Vals) 15.8% 12.9% 2.5% 11.3%

Grok 4.6 的强项:

  • Agent 长任务(APEX-Agents):57.5%,在对比模型中最高,反超 Sol Max
  • 法律知识工作(Harvey LAB):15.8%,碾压 Sol 的 2.5%——这是 xAI 刻意在 RL 阶段加入知识工程领域的结果
  • GDPVal-AA v2:1753,超过 Sol 的 1728
  • 知识检索(AA-Briefcase):1577,同样领先

Grok 4.6 的短板:

  • 仓库级编码(DeepSWE v1.1):65.9%,被 Sol 的 73.0% 甩了 7 个百分点——这是 repo-scale 的纯编码任务,Sol 确实更强
  • 终端操作(Terminal-Bench v3.0):26.0%,大幅落后 Sol 的 34.6%。注意 Terminal-Bench v3.0 是全新套件,没人超过 35%
  • Cursor IDE 编码(CursorBench):69.9%,被 Fable 5 的 70.5% 微弱领先

一句话总结:Grok 4.6 在 Agent 长任务和知识工作上有独特优势,在仓库级编码上仍然不如 Sol。 如果你主要用 IDE 里的 AI 助手写代码,Fable 5 仍然是王者;如果你在构建长周期 Agent 流程,Grok 4.6 值得一试。

后训练驱动:没有新架构,全靠数据质量

这是 Grok 4.6 最反直觉的地方:它不是新模型。

xAI 没有发布新预训练基座。Grok 4.6 是 Grok 4.5 基座拿出来做了「更长」的补充训练,然后叠了三层后训练:

  1. SFT 被 Grok 4.5 自己重写:用 4.5 生成了新的监督微调轨迹,覆盖推理、Agent、STEM、软件工程。有问题的轨迹被模型本身过滤掉了。
  2. Agentic RL:在知识工作、通用编码、内核优化、Web 开发和 CAD 等领域做强化学习。注意 CAD 和内核优化——xAI 刻意让模型在「一步错代价高」的领域训练。
  3. 更长的训练 + 改进的优化器:比 4.5 更长的补充训练,加上新的优化器和训练配方。

这个「用上一个模型写下一个模型的作业」模式已经成为全行业的标配了。xAI 把它做到了极致——训练数据、过滤规则、RL 环境,全都是内部迭代出来的。

有意思的是,xAI 还提到 4.6 开始展现出 self-testing 行为——模型在执行长轨迹时会自己检查自己的输出,在继续之前先验证。这在官方公告里只是一句话,但对于跑过 Agent 工作流的开发者来说,这是最容易共鸣的改进。

生态布局:Cursor + Grok Build + 全平台覆盖

Grok 4.6 发布首日就上了这些平台:

  • xAI API:grok-4.6 模型 ID,即刻可用
  • Cursor:首周双倍用量
  • Grok Build:xAI 自家 Agent 框架
  • OpenRouter:第三方聚合
  • Vercel:Edge 部署
  • Cloudflare:全球边缘推理

从 Cursor 的收购到 Grok Build 的开源,xAI 的策略很清楚:不做封闭生态。模型给你、框架给你、部署平台也给你。盈利靠 API 调用量,不靠锁定。

首周促销是 2x 用量——和 Grok 4.5 发布时一样的策略。如果你当时没用完双倍,这次是新的双倍窗口。

至于已经在路上的 Grok 4.7,xAI 透露是基于 2.1T 参数架构的全面升级(非后训练),预计几周内发布。所以 4.6 更像是一个「中场更新」——用后训练榨干 4.5 基座的最后一滴潜力,给 4.7 争取时间。

写在最后

Grok 4.6 是一款定位精准的产品:不追求全面领先,追求单位成本的智能密度。

它的 benchmark 不是最漂亮的——DeepSWE 73% 和 Terminal-Bench 34.6% 仍然是 Sol 的地盘。但如果你算一笔账:$2/$6 的价格拿到 AA Index 61 的智能水平,在 200K 以内的 prompt 长度下,Grok 4.6 是当前市场上性价比最高的前沿模型

2026 年的模型市场已经分化为两个阵营:一边是「贵但最强」的 Opus 5 和 Fable 5,另一边是「够用且便宜」的 Grok 4.6 和 DeepSeek V4。对于大多数工程场景——代码生成、文档分析、Agent 工作流——后者可能才是更理性的选择。

📌 相关阅读:CoreWeave Q2 营收翻倍至 $25.8 亿!$1040 亿积压订单 + 大客户矩阵,AI 云基础设施的疯狂造富时代!

By AI博士 万戈