当「不加价」成为最大的卖点
如果你关注 AI 模型市场,昨天 xAI 扔下了一颗不大不小的炸弹。
Grok 4.6,8 月 12 日正式发布——不涨价。$2/百万输入、$6/百万输出的 API 价格纹丝不动。这在 2026 年的模型军备竞赛里,已经算得上良心定价了。
但真正让开发者们兴奋的是那个数字:500,000 tokens 上下文窗口。对比 Grok 4.5 的 1M 上下文实际上还缩了水?不,4.5 的 1M 标注是理论最大值,4.6 把有效可用上下文从 128K 直接拉到了 500K。
还是先看价格对比表吧,数据说话最直接:
| 模型 | 输入价格 ($/M tokens) | 输出价格 ($/M tokens) | 上下文 | AA Index |
|---|---|---|---|---|
| Grok 4.6 | $2 | $6 | 500K | 61 |
| Grok 4.5 | $2 | $6 | 128K 有效 | 56 |
| GPT-5.6 Sol Max | $2 | $6 | 1M | 61 |
| Fable 5 Max | $5 | $15 | 1M | 62 |
| Claude Opus 5 | $15 | $75 | 200K | 63 |
Grok 4.6 以 Fable 5 的 1/3 输入价格、1/12 输出价格 拿到了几乎同级的 AA Index。Claude Opus 5 仍然是智能王者,但价格是 Grok 4.6 的 12.5 倍。
性价比这个词,2026 年终于不再是个营销话术了。
500K 上下文和暗藏的「定价悬崖」
先说好的:500K 上下文是实打实的升级。
以前 Grok 4.5 虽然标称 1M,但实际上超过 128K 之后性能就开始衰减。4.6 把可靠窗口做到了 500K——你可以在一个 prompt 里塞进《三体》三部曲的全文还有富余,然后让模型直接回答问题。
这给长距离 Agent 任务带来了质变。以 APEX-Agents 为例,Grok 4.6 得分 57.5%,比 4.5 的 47.1% 暴涨了 10.4 个百分点,甚至超过了 GPT-5.6 Sol Max 的 56.7%。
但硬币有另一面。
xAI 的定价表里藏着一个小字条款:prompt 一旦超过 200K tokens,整个请求的单价翻倍——$4 输入 / $12 输出,而且是对全部 tokens,不仅仅是超出的部分。
这叫什么?这叫「全量重定价」。
假设你做一个长文档分析项目,每个 prompt 240K tokens。理论上你该付 $0.48(240K × $2/M)。但实际上你要付 $0.96(240K × $4/M)——因为整个请求进了长上下文定价带。
xAI 管这个叫 “fast variant”。我管它叫定价悬崖——你在 200K 以内享受廉价推理,一超过阈值,成本瞬间翻倍。
对比来看:
| 场景 | Grok 4.6 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|
| 短 prompt (10K) | $0.02 | $0.02 | $0.05 |
| 中等 (100K) | $0.20 | $0.20 | $0.50 |
| 长 prompt (250K - 超阈值) | $1.00 ☠️ | $0.50 | $1.25 |
所以 Grok 4.6 的真正甜蜜点是 200K tokens 以内的场景。在这个范围内,它的性价比无人能敌。
Benchmark 全面解读:哪里赢了,哪里输了
xAI 这次放了一张 10 行的 benchmark 表,我们从工程视角逐行拆解。
| 评测 | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
| FrontierCode v1.1 | 61.3% | 56.6% | 60.6% | 63.6% |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
Grok 4.6 的强项:
- Agent 长任务(APEX-Agents):57.5%,在对比模型中最高,反超 Sol Max
- 法律知识工作(Harvey LAB):15.8%,碾压 Sol 的 2.5%——这是 xAI 刻意在 RL 阶段加入知识工程领域的结果
- GDPVal-AA v2:1753,超过 Sol 的 1728
- 知识检索(AA-Briefcase):1577,同样领先
Grok 4.6 的短板:
- 仓库级编码(DeepSWE v1.1):65.9%,被 Sol 的 73.0% 甩了 7 个百分点——这是 repo-scale 的纯编码任务,Sol 确实更强
- 终端操作(Terminal-Bench v3.0):26.0%,大幅落后 Sol 的 34.6%。注意 Terminal-Bench v3.0 是全新套件,没人超过 35%
- Cursor IDE 编码(CursorBench):69.9%,被 Fable 5 的 70.5% 微弱领先
一句话总结:Grok 4.6 在 Agent 长任务和知识工作上有独特优势,在仓库级编码上仍然不如 Sol。 如果你主要用 IDE 里的 AI 助手写代码,Fable 5 仍然是王者;如果你在构建长周期 Agent 流程,Grok 4.6 值得一试。
后训练驱动:没有新架构,全靠数据质量
这是 Grok 4.6 最反直觉的地方:它不是新模型。
xAI 没有发布新预训练基座。Grok 4.6 是 Grok 4.5 基座拿出来做了「更长」的补充训练,然后叠了三层后训练:
- SFT 被 Grok 4.5 自己重写:用 4.5 生成了新的监督微调轨迹,覆盖推理、Agent、STEM、软件工程。有问题的轨迹被模型本身过滤掉了。
- Agentic RL:在知识工作、通用编码、内核优化、Web 开发和 CAD 等领域做强化学习。注意 CAD 和内核优化——xAI 刻意让模型在「一步错代价高」的领域训练。
- 更长的训练 + 改进的优化器:比 4.5 更长的补充训练,加上新的优化器和训练配方。
这个「用上一个模型写下一个模型的作业」模式已经成为全行业的标配了。xAI 把它做到了极致——训练数据、过滤规则、RL 环境,全都是内部迭代出来的。
有意思的是,xAI 还提到 4.6 开始展现出 self-testing 行为——模型在执行长轨迹时会自己检查自己的输出,在继续之前先验证。这在官方公告里只是一句话,但对于跑过 Agent 工作流的开发者来说,这是最容易共鸣的改进。
生态布局:Cursor + Grok Build + 全平台覆盖
Grok 4.6 发布首日就上了这些平台:
- xAI API:grok-4.6 模型 ID,即刻可用
- Cursor:首周双倍用量
- Grok Build:xAI 自家 Agent 框架
- OpenRouter:第三方聚合
- Vercel:Edge 部署
- Cloudflare:全球边缘推理
从 Cursor 的收购到 Grok Build 的开源,xAI 的策略很清楚:不做封闭生态。模型给你、框架给你、部署平台也给你。盈利靠 API 调用量,不靠锁定。
首周促销是 2x 用量——和 Grok 4.5 发布时一样的策略。如果你当时没用完双倍,这次是新的双倍窗口。
至于已经在路上的 Grok 4.7,xAI 透露是基于 2.1T 参数架构的全面升级(非后训练),预计几周内发布。所以 4.6 更像是一个「中场更新」——用后训练榨干 4.5 基座的最后一滴潜力,给 4.7 争取时间。
写在最后
Grok 4.6 是一款定位精准的产品:不追求全面领先,追求单位成本的智能密度。
它的 benchmark 不是最漂亮的——DeepSWE 73% 和 Terminal-Bench 34.6% 仍然是 Sol 的地盘。但如果你算一笔账:$2/$6 的价格拿到 AA Index 61 的智能水平,在 200K 以内的 prompt 长度下,Grok 4.6 是当前市场上性价比最高的前沿模型。
2026 年的模型市场已经分化为两个阵营:一边是「贵但最强」的 Opus 5 和 Fable 5,另一边是「够用且便宜」的 Grok 4.6 和 DeepSeek V4。对于大多数工程场景——代码生成、文档分析、Agent 工作流——后者可能才是更理性的选择。
📌 相关阅读:CoreWeave Q2 营收翻倍至 $25.8 亿!$1040 亿积压订单 + 大客户矩阵,AI 云基础设施的疯狂造富时代!