<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>VoiceAgent on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/voiceagent/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Wed, 16 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/voiceagent/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Google 拆分语音产品线！Gemini 3.8 Live 登顶语音排行榜，定价打到 GPT-Live-1 的 1/10！</title>
        <link>https://www.yesmiracle.net/post/20260916-gemini-3-8-live/</link>
        <pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260916-gemini-3-8-live/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260916-gemini-3-8-live/cover.svg" alt="Featured image of post Google 拆分语音产品线！Gemini 3.8 Live 登顶语音排行榜，定价打到 GPT-Live-1 的 1/10！" /&gt;&lt;p&gt;昨天你还在为 OpenAI 的 $0.05/分钟语音定价肉疼——今天 Google 就甩了一张 $0.005/分钟的牌，外加一张 82.6 分的排行榜第一。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;核心数据：一个模型，两次拆分，四倍差价。&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;模型&lt;/th&gt;
          &lt;th&gt;S2S 指数&lt;/th&gt;
          &lt;th&gt;τ-Voice 任务完成率&lt;/th&gt;
          &lt;th&gt;每小时音频成本&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Gemini 3.8 Live (标准)&lt;/td&gt;
          &lt;td&gt;76.0&lt;/td&gt;
          &lt;td&gt;30.1%&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;$0.84&lt;/strong&gt; 🟢&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Gemini 3.8 Live Extended Thinking&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;82.6 🥇&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;68.6%&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;$3.50&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;GPT-Live-1 (Astra, Medium)&lt;/td&gt;
          &lt;td&gt;81.5&lt;/td&gt;
          &lt;td&gt;67.9%&lt;/td&gt;
          &lt;td&gt;$5.83&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Grok Voice Think Fast 2.0 High&lt;/td&gt;
          &lt;td&gt;81.3&lt;/td&gt;
          &lt;td&gt;56.5%&lt;/td&gt;
          &lt;td&gt;$4.80&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;GPT-Live-1 (Sol, Low)&lt;/td&gt;
          &lt;td&gt;80.1&lt;/td&gt;
          &lt;td&gt;59.3%&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;GPT-Realtime-2.1 High&lt;/td&gt;
          &lt;td&gt;73.9&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
          &lt;td&gt;$10.75&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;表格里最炸裂的不是 Gemini 登顶——是 Extended Thinking 比 GPT-Live-1 (Astra) 贵吗？&lt;strong&gt;便宜 40%&lt;/strong&gt;。标准版更是把每小时成本卷到 $0.84——比第二名低了几乎一个数量级。OpenAI 的 GPT-Realtime-2.1 High 每小时 $10.75，是 Gemini 标准版的 &lt;strong&gt;12.8 倍&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这不是一次普通的模型升级。这是一次产品线的&lt;strong&gt;哲学分裂&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id=&#34;两个模型两种哲学&#34;&gt;两个模型，两种哲学&lt;/h3&gt;
&lt;p&gt;Google DeepMind 的官方博客把这件事说得很清楚：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Gemini 3.8 Live：Built for scale and cost efficiency, combining conversational intelligence with fluid dialogue and visual grounding.&lt;/p&gt;
&lt;p&gt;Gemini 3.8 Live Extended Thinking：Built for high-complexity tasks, with increased intelligence and multi-step reasoning.&lt;/p&gt;&lt;/blockquote&gt;
&lt;p&gt;翻译成人话：&lt;strong&gt;一个当话务员，一个当项目经理。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;3.8 Live（标准版）做的事情是——实时视觉输入处理、97 种语言中自动切换、后台执行 Tool/API 调用且不中断对话。它是一个真正能「一边查资料一边聊天」的语音接口。&lt;/p&gt;
&lt;p&gt;3.8 Live Extended Thinking 做的事情是——&lt;strong&gt;边思考边说话&lt;/strong&gt;。它在执行多步任务时，会用「Let me check that…」这类口头语来续住对话，而不是沉默地等计算结束。这不是小聪明——这是用户对语音 Agent 最大的抱怨之一：沉默 = 断开连接。&lt;/p&gt;
&lt;p&gt;由 OrcaRouter 的分析拆开八个维度后发现，这两个模型的核心差异不在「谁更强」，而在「谁更适合什么」：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th&gt;Extended Thinking&lt;/th&gt;
          &lt;th&gt;标准版&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;S2S 总指数&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;82.6 🥇&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;76.0&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;智能体任务完成 (τ-Voice)&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;68.6%&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;30.1%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;语音推理 (Big Bench Audio)&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;98%&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;92%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;对话动态评分&lt;/td&gt;
          &lt;td&gt;91.9%&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;96.1%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Arena 偏好 (Elo)&lt;/td&gt;
          &lt;td&gt;990&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;1083&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;任务成功率&lt;/td&gt;
          &lt;td&gt;89.1%&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;93.2%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;首次发声时间&lt;/td&gt;
          &lt;td&gt;1.35s&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;1.18s&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;每小时音频成本&lt;/td&gt;
          &lt;td&gt;$3.50&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;$0.84&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;有趣的事来了：&lt;strong&gt;标准版赢了四个维度&lt;/strong&gt;。更快、更受欢迎、对话更自然、任务成功率更高。它输的那一个——30.1% vs 68.6% 的 τ-Voice 任务完成率——恰好是&lt;strong&gt;语音 Agent 和语音接口的分界线&lt;/strong&gt;。如果你的 Agent 只需要接电话、传话、查信息，标准版就够了。如果你的 Agent 需要在对话中完成任务链，「等等我查一下」，你得多付 4 倍每小时成本换那个 38 分的差距。&lt;/p&gt;
&lt;h3 id=&#34;定价悬崖110-是怎样炼成的&#34;&gt;定价悬崖：1/10 是怎样炼成的&lt;/h3&gt;
&lt;p&gt;Google 这次在定价上极其激进。两个模型共享同一张价目表：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;音频输入&lt;/strong&gt;：$0.005/分钟&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;音频输出&lt;/strong&gt;：$0.018/分钟&lt;/li&gt;
&lt;li&gt;整整一小时语音对话 ≈ &lt;strong&gt;$1.38&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;同样的对话量，OpenAI GPT-Live-1 至少 &lt;strong&gt;$3.00&lt;/strong&gt;，GPT-Realtime-2.1 High 更是 &lt;strong&gt;$10.75&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;文本定价也一并刷新：Gemini 3.8 Live 文本 token $0.75/M 输入、$4.50/M 输出、$3.00/M 音频 token 输入、$12.00/M 音频 token 输出。粗看不便宜，但在语音场景下——你一小时说不了几个 token——按分钟计费的方式反而把账单压到最低。&lt;/p&gt;
&lt;p&gt;这意味着如果你在跑语音客服，每天 1000 小时对话量：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Gemini 3.8 Live → $1,380/天&lt;/li&gt;
&lt;li&gt;GPT-Live-1 → $3,000+/天&lt;/li&gt;
&lt;li&gt;月差：&lt;strong&gt;$48,600&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;对 CTO 来说，这差距大到不需要做 A/B 测试。&lt;/p&gt;
&lt;h3 id=&#34;能力清单不只是便宜&#34;&gt;能力清单：不只是便宜&lt;/h3&gt;
&lt;p&gt;便宜不等丐版。3.8 Live 的能力清单其实很耐看：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;97 种语言自动切换（对话中无需中断）&lt;/strong&gt; — 不是「预选一种语言」，而是「你说什么语言我就切换」。这对跨国客服场景是核武器。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;实时视觉输入&lt;/strong&gt; — 可以「看着你做」并实时反馈。Google 的 demo 中展示了实时下棋、员工入职指导。这对远程支持/维修场景很实用。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;后台 Tool/API 执行 + 不断话&lt;/strong&gt; — Agent 可以在后台调 API、查数据库、发邮件的同时继续聊。这看起来「应该有的」能力，在今天的语音产品中反而是少数——大多数语音 Agent 在调 API 时会沉默等待返回。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SynthID 水印&lt;/strong&gt; — 所有生成音频自带水印，不可感知但在检测时可以被识别。对合规敏感的企业场景来说，这个 feature 比任何 benchmark 分数都重要。&lt;/p&gt;
&lt;h3 id=&#34;竞品定位谁被夹击了&#34;&gt;竞品定位：谁被夹击了&lt;/h3&gt;
&lt;p&gt;打开 Artificial Analysis 的 Speech-to-Speech 排行榜（2026-09-16 截图），前三名是：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Gemini 3.8 Live Extended Thinking&lt;/strong&gt; — 82.6&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GPT-Live-1 (Astra, Medium)&lt;/strong&gt; — 81.5&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Grok Voice Think Fast 2.0 High&lt;/strong&gt; — 81.3&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Extended Thinking 和 GPT-Live-1 Astra 的差距只有 &lt;strong&gt;1.1 分&lt;/strong&gt;，在 τ-Voice 上也只有 0.7 个百分点（68.6% vs 67.9%）——这个差距很薄，薄到可能只是噪声。但结合定价：GPT-Live-1 Astra 每小时 $5.83，Extended Thinking $3.50——便宜 40% 的情况下打平甚至略胜，OpenAI 的压力很大。&lt;/p&gt;
&lt;p&gt;Grok Voice Think Fast 2.0 排在第三（81.3），成本 $4.80/小时——比 Gemini 贵 37%，得分低 1.3。xAI 在语音赛道上的优势被直接打掉了。&lt;/p&gt;
&lt;p&gt;标准版 Gemini 3.8 Live 排第五（76.0），但它每小时 $0.84 的定价让这个位置完全不丢人——它用其它模型 1/6 的价格打平了对话质量，甚至更受欢迎（Arena Elo 1083 vs GPT-Live-1 的 ~1000）。&lt;/p&gt;
&lt;h3 id=&#34;private-preview这个限定词&#34;&gt;「Private Preview」这个限定词&lt;/h3&gt;
&lt;p&gt;Google 的品宣图文非常坦诚地使用了「Private Preview」这个词。两个模型都不是 GA（一般可用），意味着：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;开发者可用&lt;/strong&gt;：在 Gemini API、Live API 和 Google AI Studio 里直接用，定价已公布&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;企业可用&lt;/strong&gt;：Gemini Enterprise 的 Private Preview&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;消费级可用&lt;/strong&gt;：3.8 Live Extended Thinking 已在 Gemini Live、Gmail Live、Keep Live 中上线&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;缺失的&lt;/strong&gt;：GA 承诺、SLA、定价锁定期&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;如果你在做语音 Agent 原型、内测、MVP——今天就能接入，api 路径是 &lt;code&gt;gemini-3.8-live&lt;/code&gt; 和 &lt;code&gt;gemini-3.8-live-extended-thinking&lt;/code&gt;。如果你要把关键客户电话放到这条线上——等 GA。&lt;/p&gt;
&lt;h3 id=&#34;写在最后&#34;&gt;写在最后&lt;/h3&gt;
&lt;p&gt;这次发布最值得关注的不是 Benchmark 分数。是这个定价策略背后的信号：Google 不再在模型能力上跟 OpenAI 拼刺刀，它选择在&lt;strong&gt;成本结构&lt;/strong&gt;上制造不对称。&lt;/p&gt;
&lt;p&gt;OpenAI 的 GPT-Live-1 价格 $0.05/分钟，Google 的 $0.005/分钟——10 倍的价差不可能是巧合。这是 Google 在用 GCP 的规模优势碾压推理成本。当 OpenAI 还在打磨模型时，Google 已经建造了一台「语音生成空压机」——每分钟出气成本压到对手的 1/10。&lt;/p&gt;
&lt;p&gt;下一波 AI 语音 Agent 的战争，比的不是谁的模型更聪明，是&lt;strong&gt;谁更敢在大规模对话中免费说话&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;对开发者来说，今天就是你开始跑语音 Agent 的最好时机。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;延伸阅读&lt;/strong&gt;：如果你在关注 AI Agent 的安全性，可以看 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260910-anthropic-claude-four-incidents/&#34; &gt;《Anthropic 自曝 Claude 四起越权事件！Mythos 5 上 PyPI 投毒、Opus 4.7 攻击真实公司——METR 启动独立调查！》&lt;/a&gt;。&lt;/p&gt;&lt;/blockquote&gt;
&lt;p&gt;📌 本博客所有原创内容采用 CC-BY-NC-ND 4.0 协议。&lt;/p&gt;</description>
        </item>
        
    </channel>
</rss>
