<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>多模态 on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/%E5%A4%9A%E6%A8%A1%E6%80%81/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Sun, 20 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/%E5%A4%9A%E6%A8%A1%E6%80%81/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Qwen3.8-Omni-Flash 横空出世！全模态 1M 上下文 &#43; Agent 感知，定价打到 Gemini Flash 的 1/5！</title>
        <link>https://www.yesmiracle.net/post/20260920-qwen3-8-omni-flash-release/</link>
        <pubDate>Sun, 20 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260920-qwen3-8-omni-flash-release/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260920-qwen3-8-omni-flash-release/cover.svg" alt="Featured image of post Qwen3.8-Omni-Flash 横空出世！全模态 1M 上下文 &#43; Agent 感知，定价打到 Gemini Flash 的 1/5！" /&gt;&lt;p&gt;如果你最近在用多模态 API，一定知道那个数字：&lt;strong&gt;Gemini 3.8 Flash，输入 $0.75/M tokens，输出 $3.75/M tokens&lt;/strong&gt;。Google 的 Flash 系列一直是多模态性价比的标杆。&lt;/p&gt;
&lt;p&gt;然后昨天，阿里直接把桌子掀了。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Qwen3.8-Omni-Flash&lt;/strong&gt;：输入 &lt;strong&gt;$0.15/M tokens&lt;/strong&gt;，输出 &lt;strong&gt;$0.47/M tokens&lt;/strong&gt;。整份账单只有 Gemini 3.8 Flash 的 &lt;strong&gt;1/5&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;而且不是「便宜但弱」——它在多模态 Benchmark 上的表现&lt;strong&gt;接近甚至超过&lt;/strong&gt; Gemini 3.8 Flash，尤其是在音频理解方面。更重要的是，它引入了一个叫 &lt;strong&gt;Agentic Perception&lt;/strong&gt; 的东西：&lt;strong&gt;不是逐帧处理视频，而是让模型自己决定「看哪里」&lt;/strong&gt;，结果 tokens 省了 45.7%，准确率反而提升了。&lt;/p&gt;
&lt;p&gt;这篇文章帮你拆解：它到底是什么、凭什么这么便宜、以及这对你意味着什么。&lt;/p&gt;
&lt;h2 id=&#34;不是简化版是另一条路线&#34;&gt;不是「简化版」，是「另一条路线」&lt;/h2&gt;
&lt;p&gt;先厘清一件事：Qwen3.8-Omni-Flash 不是 Qwen 3.8 旗舰版（2.4T 参数 MoE）的精简版，而是一个&lt;strong&gt;原生全模态模型&lt;/strong&gt;。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.8-Omni-Flash&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen 3.8（旗舰版）&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Gemini 3.8 Flash&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;架构基础&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;Qwen3.8-Flash-Next&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;2.4T MoE (A95B)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;Gemini 3.8&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;输入模态&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;文本/图像/音频/视频&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;文本/图像/视频&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;文本/图像/音频/视频&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;输出&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;文本&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;文本&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;文本&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;上下文&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1M tokens&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1M tokens&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1M tokens&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;定价（输入）&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$0.15/M&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$2.00/M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.75/M&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;定价（输出）&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$0.47/M&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$6.00/M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$3.75/M&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;开放权重&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;❌ API only&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;✅ 开源&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;❌&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;发布日期&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;2026-09-18&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;2026-08-03&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;2026-09-02&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;注意这个关键差异：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Qwen 3.8 旗舰版是「推理引擎也能看视频」&lt;/strong&gt;，而 &lt;strong&gt;Qwen3.8-Omni-Flash 是「感知与行动引擎也会推理」&lt;/strong&gt;。前者优化的是&lt;strong&gt;每个 token 的深度&lt;/strong&gt;，后者优化的是&lt;strong&gt;每小时内容的 token 成本&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;OrcaRouter 的分析师 Alistair Wren 说得直白：「两个模型共享一个家族名和一个 1M 上下文窗口，但它们不是替代品，而是回答完全不同的问题。」&lt;/p&gt;
&lt;h2 id=&#34;agentic-perception不是看完再想是想好了再看&#34;&gt;Agentic Perception：不是看完再想，是想好了再看&lt;/h2&gt;
&lt;p&gt;这是 Qwen3.8-Omni-Flash 最核心的技术亮点。&lt;/p&gt;
&lt;p&gt;大多数视频理解模型的做法是：&lt;strong&gt;把整个视频从头到尾逐帧编码，然后问问题&lt;/strong&gt;。如果一段 2 小时的视频里答案只出现在 3 分钟里，那 95% 的计算被浪费了。&lt;/p&gt;
&lt;p&gt;Qwen 团队的做法是反过来：&lt;strong&gt;从问题出发，让模型决定看什么、听什么&lt;/strong&gt;。它按照 coarse-to-fine 的多轮搜索策略逐步定位相关片段，只处理需要的那部分。&lt;/p&gt;
&lt;p&gt;结果：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;指标&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;逐帧处理&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Agentic Perception&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;变化&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;OmniVideoBench 准确率&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;63.4&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;67.8&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+4.4&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;每查询 tokens 消耗&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;145,736&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;79,117&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;-45.7%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;又省 token 又提分&lt;/strong&gt;——这在 AI 领域是罕见的「双重红利」。通常省计算就意味着牺牲质量，但 Agentic Perception 通过更智能的采样策略打破了这种权衡。&lt;/p&gt;
&lt;h2 id=&#34;benchmark凭数据说话&#34;&gt;Benchmark：凭数据说话&lt;/h2&gt;
&lt;p&gt;Qwen 团队在 29 项评测上做了对比，相比上一代 Qwen3.5-Omni-Plus，平均提升超过 &lt;strong&gt;26%&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id=&#34;文本与编码能力&#34;&gt;文本与编码能力&lt;/h3&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;评测项&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.8-Omni-Flash&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.5-Omni-Plus&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;提升&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Terminal-Bench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;60.5&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;48.2&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+12.3&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;LiveCodeBench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;52.1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;41.8&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+10.3&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;IFBench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;84.2&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;72.6&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+11.6&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;GPQA Diamond&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;56.8&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;45.3&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+11.5&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id=&#34;多模态与感知能力&#34;&gt;多模态与感知能力&lt;/h3&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;评测项&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.8-Omni-Flash&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.5-Omni-Plus&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;对比 Gemini 3.8 Flash&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;WildClawBench-MM&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;71.0&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;34.5&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;AgenticVBench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;82.1&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;59.8&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;UniClawBench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;69.6&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;OmniVideoBench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;67.8&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;58.2&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;接近&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;LongAudioSpan&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;63.5&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;55.2&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;接近&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;VoiceBench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;91.6&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;超过&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen 团队特别指出：&lt;strong&gt;音频整体表现超过 Gemini 3.8 Flash&lt;/strong&gt;，音视频综合性能接近。考虑到 1/5 的价格，这个成绩非常能打。&lt;/p&gt;
&lt;h3 id=&#34;agent-与工具调用&#34;&gt;Agent 与工具调用&lt;/h3&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;评测项&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.8-Omni-Flash&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;说明&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;WildClawBench-MM&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;71.0&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;+36.5 vs 前代&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;StreamingBench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;80.8&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;流式 Agent 任务&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;AliMeeting DER&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;3.35&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;会议角色分离（越低越好）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;AliMeeting CPWER&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;17.18&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;词错误率（越低越好）&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;AliMeeting 的数据对比最夸张：DER 从前代 88.11 降到 3.35——&lt;strong&gt;25 倍的改进&lt;/strong&gt;，这已经不是「迭代」而是「换赛道」了。&lt;/p&gt;
&lt;p&gt;🚀 &lt;strong&gt;最大亮点&lt;/strong&gt;：WildClawBench-MM 提升 36.5 分，是全部评测中增幅最大的，也是 Agentic Perception 能力最直接的证明。&lt;/p&gt;
&lt;h2 id=&#34;定价深度对比15-不是全部故事&#34;&gt;定价深度对比：1/5 不是全部故事&lt;/h2&gt;
&lt;h3 id=&#34;费率对比&#34;&gt;费率对比&lt;/h3&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;费率项&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.8-Omni-Flash&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Gemini 3.8 Flash&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;倍数&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;输入 ($/M tokens)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$0.15&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.75&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;5x&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输出 ($/M tokens)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$0.47&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$3.75&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;8x&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;缓存命中 ($/M tokens)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$0.016&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.03125&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;2x&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;音频输入（每小时）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;~$0.36&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;比上代降 &lt;strong&gt;98%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;音视频输入（每小时）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;~$0.72&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;比上代降 &lt;strong&gt;93%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;视频输入（每小时）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;~$1.44&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;比上代降 &lt;strong&gt;89%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;真正的冲击在媒体输入。Qwen 团队公布的数据显示，音频输入成本相比 Qwen3.5-Omni-Plus &lt;strong&gt;下降了超过 98%&lt;/strong&gt;，音视频输入下降 93%，视频输入下降 89%。&lt;/p&gt;
&lt;p&gt;这意味着什么？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;如果你在做音视频分析——会议转录、播客摘要、视频内容审核——Qwen3.8-Omni-Flash 极大降低了把「全量媒体输入」变成产品标配的成本门槛&lt;/strong&gt;。以前只能在关键片段上做 AI 分析的场景，现在可以整段扔进去。&lt;/p&gt;
&lt;h3 id=&#34;场景化成本对比&#34;&gt;场景化成本对比&lt;/h3&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;场景&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;每周用量&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.8-Omni-Flash&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Gemini 3.8 Flash&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;节省&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;客服通话分析（10 万通/周）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~200M tokens&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$30/周&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$150/周&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;80%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;视频内容审核（1000 小时/周）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~500M tokens&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$75/周&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$375/周&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;80%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;通用多模态推理（100 万次/周）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~300M tokens&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$45/周&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$225/周&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;80%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;上面的场景化计算基于输入为主的 workload，输出场景差距更大（8x）。&lt;/p&gt;
&lt;h2 id=&#34;部署六区域openai-协议即开即用&#34;&gt;部署：六区域、OpenAI 协议、即开即用&lt;/h2&gt;
&lt;p&gt;Qwen3.8-Omni-Flash 目前是 &lt;strong&gt;API only&lt;/strong&gt;，暂时没有开放权重。但部署支持很全面：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;六区域覆盖&lt;/strong&gt;：北京、新加坡、香港、东京、法兰克福、弗吉尼亚&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;API 兼容&lt;/strong&gt;：同时支持 DashScope 和 OpenAI 协议，无需改代码&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;功能齐全&lt;/strong&gt;：Function Calling、Web Search、Structured Outputs、Context Caching、Batch 全部支持&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;视频输入&lt;/strong&gt;：支持最多 2 小时/2GB 视频文件（通过 URL），15fps 稳定采样&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;音频输入&lt;/strong&gt;：支持最多 3 小时，113 种语言&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多声道&lt;/strong&gt;：支持双声道立体声和四声道 FOA 空间音频&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;调用方式只需要几行 Python：&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#f92672&#34;&gt;from&lt;/span&gt; openai &lt;span style=&#34;color:#f92672&#34;&gt;import&lt;/span&gt; OpenAI
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;client &lt;span style=&#34;color:#f92672&#34;&gt;=&lt;/span&gt; OpenAI(
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    api_key&lt;span style=&#34;color:#f92672&#34;&gt;=&lt;/span&gt;os&lt;span style=&#34;color:#f92672&#34;&gt;.&lt;/span&gt;environ[&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;DASHSCOPE_API_KEY&amp;#34;&lt;/span&gt;],
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    base_url&lt;span style=&#34;color:#f92672&#34;&gt;=&lt;/span&gt;os&lt;span style=&#34;color:#f92672&#34;&gt;.&lt;/span&gt;environ[&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;DASHSCOPE_BASE_URL&amp;#34;&lt;/span&gt;],
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;completion &lt;span style=&#34;color:#f92672&#34;&gt;=&lt;/span&gt; client&lt;span style=&#34;color:#f92672&#34;&gt;.&lt;/span&gt;chat&lt;span style=&#34;color:#f92672&#34;&gt;.&lt;/span&gt;completions&lt;span style=&#34;color:#f92672&#34;&gt;.&lt;/span&gt;create(
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    model&lt;span style=&#34;color:#f92672&#34;&gt;=&lt;/span&gt;&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;qwen3.8-omni-flash&amp;#34;&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    messages&lt;span style=&#34;color:#f92672&#34;&gt;=&lt;/span&gt;[{
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;        &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;role&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;user&amp;#34;&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;        &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;content&amp;#34;&lt;/span&gt;: [
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;            {&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;type&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;video_url&amp;#34;&lt;/span&gt;, &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;video_url&amp;#34;&lt;/span&gt;: {&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;url&amp;#34;&lt;/span&gt;: video_url}},
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;            {&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;type&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;text&amp;#34;&lt;/span&gt;, &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;text&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;列出关键事件的时间戳。&amp;#34;&lt;/span&gt;},
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;        ]
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    }],
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    modalities&lt;span style=&#34;color:#f92672&#34;&gt;=&lt;/span&gt;[&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;text&amp;#34;&lt;/span&gt;],
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;默认为思考模式（&lt;code&gt;reasoning_effort&lt;/code&gt; 默认 &lt;code&gt;xhigh&lt;/code&gt;），可以关闭。&lt;/p&gt;
&lt;h2 id=&#34;不止模型开源工具链补全生态&#34;&gt;不止模型：开源工具链补全生态&lt;/h2&gt;
&lt;p&gt;Qwen 团队同步开源了两套工具：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Qwen-MM-Plugins&lt;/strong&gt;（Apache-2.0）：一套插件系统，让本地 Agent 框架（Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code、Gemini CLI）能直接调用 Omni 模型的多模态能力。核心功能包含：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;omni-memory&lt;/code&gt;：构建音视频长期记忆&lt;/li&gt;
&lt;li&gt;&lt;code&gt;omni-video2note&lt;/code&gt;：把教程视频转成带图 PDF&lt;/li&gt;
&lt;li&gt;&lt;code&gt;omni-chatcut&lt;/code&gt;：音乐 MV 解说、电影评论、视频翻译&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;Qwen-Live Harness&lt;/strong&gt;：开源的 Agent 能力评测框架，可复现 WildClawBench 等评测。&lt;/p&gt;
&lt;p&gt;目前有一个已知缺口：&lt;strong&gt;本地 harness 还不能原生传递音频到主模型&lt;/strong&gt;，音频需要通过 API 路由。README 已经标注了这个问题。&lt;/p&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;
&lt;p&gt;Qwen3.8-Omni-Flash 的意义不止于「又一个便宜的多模态模型」。&lt;/p&gt;
&lt;p&gt;它标志着一个转变：&lt;strong&gt;Flash 类模型的竞争从「堆参数」转向了「堆感知效率」&lt;/strong&gt;。Agentic Perception 技术——让模型自己决定看什么——比单纯增加上下文窗口更有工程价值。因为它直接影响了使用成本曲线。&lt;/p&gt;
&lt;p&gt;对于做音视频 AI 产品的团队来说，这个模型提供的不仅是 1/5 的价格，更是一个产品设计空间的打开：&lt;strong&gt;当「把整个视频扔进去分析」的成本低到可以忽略不计时，你能做哪些以前不敢做的功能？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这可能是今年多模态赛道上最重要的一次定价信号。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;📌 &lt;strong&gt;延伸阅读&lt;/strong&gt;：如果你对 Qwen 生态感兴趣，可以看看我上个月写的 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260815-qwen3-8-27b-open-source-release/&#34; &gt;《Qwen 3.8-27B 开源发布！》&lt;/a&gt;——那篇聊的是开源的 27B 推理模型，和今天的全模态 API 是同一个家族的不同分支。另外，&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260916-gemini-3-8-live/&#34; &gt;《Google 拆分语音产品线！Gemini 3.8 Live 登顶语音排行榜》&lt;/a&gt; 可以帮你了解今天文章里的对比对象 Gemini Flash 的全貌。&lt;/p&gt;&lt;/blockquote&gt;
</description>
        </item>
        
    </channel>
</rss>
