昨天你还在为 OpenAI 的 $0.05/分钟语音定价肉疼——今天 Google 就甩了一张 $0.005/分钟的牌,外加一张 82.6 分的排行榜第一。
核心数据:一个模型,两次拆分,四倍差价。
| 模型 | S2S 指数 | τ-Voice 任务完成率 | 每小时音频成本 |
|---|---|---|---|
| Gemini 3.8 Live (标准) | 76.0 | 30.1% | $0.84 🟢 |
| Gemini 3.8 Live Extended Thinking | 82.6 🥇 | 68.6% | $3.50 |
| GPT-Live-1 (Astra, Medium) | 81.5 | 67.9% | $5.83 |
| Grok Voice Think Fast 2.0 High | 81.3 | 56.5% | $4.80 |
| GPT-Live-1 (Sol, Low) | 80.1 | 59.3% | — |
| GPT-Realtime-2.1 High | 73.9 | — | $10.75 |
表格里最炸裂的不是 Gemini 登顶——是 Extended Thinking 比 GPT-Live-1 (Astra) 贵吗?便宜 40%。标准版更是把每小时成本卷到 $0.84——比第二名低了几乎一个数量级。OpenAI 的 GPT-Realtime-2.1 High 每小时 $10.75,是 Gemini 标准版的 12.8 倍。
这不是一次普通的模型升级。这是一次产品线的哲学分裂。
两个模型,两种哲学
Google DeepMind 的官方博客把这件事说得很清楚:
Gemini 3.8 Live:Built for scale and cost efficiency, combining conversational intelligence with fluid dialogue and visual grounding.
Gemini 3.8 Live Extended Thinking:Built for high-complexity tasks, with increased intelligence and multi-step reasoning.
翻译成人话:一个当话务员,一个当项目经理。
3.8 Live(标准版)做的事情是——实时视觉输入处理、97 种语言中自动切换、后台执行 Tool/API 调用且不中断对话。它是一个真正能「一边查资料一边聊天」的语音接口。
3.8 Live Extended Thinking 做的事情是——边思考边说话。它在执行多步任务时,会用「Let me check that…」这类口头语来续住对话,而不是沉默地等计算结束。这不是小聪明——这是用户对语音 Agent 最大的抱怨之一:沉默 = 断开连接。
由 OrcaRouter 的分析拆开八个维度后发现,这两个模型的核心差异不在「谁更强」,而在「谁更适合什么」:
| 维度 | Extended Thinking | 标准版 |
|---|---|---|
| S2S 总指数 | 82.6 🥇 | 76.0 |
| 智能体任务完成 (τ-Voice) | 68.6% | 30.1% |
| 语音推理 (Big Bench Audio) | 98% | 92% |
| 对话动态评分 | 91.9% | 96.1% |
| Arena 偏好 (Elo) | 990 | 1083 |
| 任务成功率 | 89.1% | 93.2% |
| 首次发声时间 | 1.35s | 1.18s |
| 每小时音频成本 | $3.50 | $0.84 |
有趣的事来了:标准版赢了四个维度。更快、更受欢迎、对话更自然、任务成功率更高。它输的那一个——30.1% vs 68.6% 的 τ-Voice 任务完成率——恰好是语音 Agent 和语音接口的分界线。如果你的 Agent 只需要接电话、传话、查信息,标准版就够了。如果你的 Agent 需要在对话中完成任务链,「等等我查一下」,你得多付 4 倍每小时成本换那个 38 分的差距。
定价悬崖:1/10 是怎样炼成的
Google 这次在定价上极其激进。两个模型共享同一张价目表:
- 音频输入:$0.005/分钟
- 音频输出:$0.018/分钟
- 整整一小时语音对话 ≈ $1.38
- 同样的对话量,OpenAI GPT-Live-1 至少 $3.00,GPT-Realtime-2.1 High 更是 $10.75
文本定价也一并刷新:Gemini 3.8 Live 文本 token $0.75/M 输入、$4.50/M 输出、$3.00/M 音频 token 输入、$12.00/M 音频 token 输出。粗看不便宜,但在语音场景下——你一小时说不了几个 token——按分钟计费的方式反而把账单压到最低。
这意味着如果你在跑语音客服,每天 1000 小时对话量:
- Gemini 3.8 Live → $1,380/天
- GPT-Live-1 → $3,000+/天
- 月差:$48,600
对 CTO 来说,这差距大到不需要做 A/B 测试。
能力清单:不只是便宜
便宜不等丐版。3.8 Live 的能力清单其实很耐看:
97 种语言自动切换(对话中无需中断) — 不是「预选一种语言」,而是「你说什么语言我就切换」。这对跨国客服场景是核武器。
实时视觉输入 — 可以「看着你做」并实时反馈。Google 的 demo 中展示了实时下棋、员工入职指导。这对远程支持/维修场景很实用。
后台 Tool/API 执行 + 不断话 — Agent 可以在后台调 API、查数据库、发邮件的同时继续聊。这看起来「应该有的」能力,在今天的语音产品中反而是少数——大多数语音 Agent 在调 API 时会沉默等待返回。
SynthID 水印 — 所有生成音频自带水印,不可感知但在检测时可以被识别。对合规敏感的企业场景来说,这个 feature 比任何 benchmark 分数都重要。
竞品定位:谁被夹击了
打开 Artificial Analysis 的 Speech-to-Speech 排行榜(2026-09-16 截图),前三名是:
- Gemini 3.8 Live Extended Thinking — 82.6
- GPT-Live-1 (Astra, Medium) — 81.5
- Grok Voice Think Fast 2.0 High — 81.3
Extended Thinking 和 GPT-Live-1 Astra 的差距只有 1.1 分,在 τ-Voice 上也只有 0.7 个百分点(68.6% vs 67.9%)——这个差距很薄,薄到可能只是噪声。但结合定价:GPT-Live-1 Astra 每小时 $5.83,Extended Thinking $3.50——便宜 40% 的情况下打平甚至略胜,OpenAI 的压力很大。
Grok Voice Think Fast 2.0 排在第三(81.3),成本 $4.80/小时——比 Gemini 贵 37%,得分低 1.3。xAI 在语音赛道上的优势被直接打掉了。
标准版 Gemini 3.8 Live 排第五(76.0),但它每小时 $0.84 的定价让这个位置完全不丢人——它用其它模型 1/6 的价格打平了对话质量,甚至更受欢迎(Arena Elo 1083 vs GPT-Live-1 的 ~1000)。
「Private Preview」这个限定词
Google 的品宣图文非常坦诚地使用了「Private Preview」这个词。两个模型都不是 GA(一般可用),意味着:
- 开发者可用:在 Gemini API、Live API 和 Google AI Studio 里直接用,定价已公布
- 企业可用:Gemini Enterprise 的 Private Preview
- 消费级可用:3.8 Live Extended Thinking 已在 Gemini Live、Gmail Live、Keep Live 中上线
- 缺失的:GA 承诺、SLA、定价锁定期
如果你在做语音 Agent 原型、内测、MVP——今天就能接入,api 路径是 gemini-3.8-live 和 gemini-3.8-live-extended-thinking。如果你要把关键客户电话放到这条线上——等 GA。
写在最后
这次发布最值得关注的不是 Benchmark 分数。是这个定价策略背后的信号:Google 不再在模型能力上跟 OpenAI 拼刺刀,它选择在成本结构上制造不对称。
OpenAI 的 GPT-Live-1 价格 $0.05/分钟,Google 的 $0.005/分钟——10 倍的价差不可能是巧合。这是 Google 在用 GCP 的规模优势碾压推理成本。当 OpenAI 还在打磨模型时,Google 已经建造了一台「语音生成空压机」——每分钟出气成本压到对手的 1/10。
下一波 AI 语音 Agent 的战争,比的不是谁的模型更聪明,是谁更敢在大规模对话中免费说话。
对开发者来说,今天就是你开始跑语音 Agent 的最好时机。
延伸阅读:如果你在关注 AI Agent 的安全性,可以看 《Anthropic 自曝 Claude 四起越权事件!Mythos 5 上 PyPI 投毒、Opus 4.7 攻击真实公司——METR 启动独立调查!》。
📌 本博客所有原创内容采用 CC-BY-NC-ND 4.0 协议。