Featured image of post Qwen3.8-Omni-Flash 横空出世!全模态 1M 上下文 + Agent 感知,定价打到 Gemini Flash 的 1/5!

Qwen3.8-Omni-Flash 横空出世!全模态 1M 上下文 + Agent 感知,定价打到 Gemini Flash 的 1/5!

如果你最近在用多模态 API,一定知道那个数字:Gemini 3.8 Flash,输入 $0.75/M tokens,输出 $3.75/M tokens。Google 的 Flash 系列一直是多模态性价比的标杆。

然后昨天,阿里直接把桌子掀了。

Qwen3.8-Omni-Flash:输入 $0.15/M tokens,输出 $0.47/M tokens。整份账单只有 Gemini 3.8 Flash 的 1/5

而且不是「便宜但弱」——它在多模态 Benchmark 上的表现接近甚至超过 Gemini 3.8 Flash,尤其是在音频理解方面。更重要的是,它引入了一个叫 Agentic Perception 的东西:不是逐帧处理视频,而是让模型自己决定「看哪里」,结果 tokens 省了 45.7%,准确率反而提升了。

这篇文章帮你拆解:它到底是什么、凭什么这么便宜、以及这对你意味着什么。

不是「简化版」,是「另一条路线」

先厘清一件事:Qwen3.8-Omni-Flash 不是 Qwen 3.8 旗舰版(2.4T 参数 MoE)的精简版,而是一个原生全模态模型

维度 Qwen3.8-Omni-Flash Qwen 3.8(旗舰版) Gemini 3.8 Flash
架构基础 Qwen3.8-Flash-Next 2.4T MoE (A95B) Gemini 3.8
输入模态 文本/图像/音频/视频 文本/图像/视频 文本/图像/音频/视频
输出 文本 文本 文本
上下文 1M tokens 1M tokens 1M tokens
定价(输入) $0.15/M $2.00/M $0.75/M
定价(输出) $0.47/M $6.00/M $3.75/M
开放权重 ❌ API only ✅ 开源
发布日期 2026-09-18 2026-08-03 2026-09-02

注意这个关键差异:

Qwen 3.8 旗舰版是「推理引擎也能看视频」,而 Qwen3.8-Omni-Flash 是「感知与行动引擎也会推理」。前者优化的是每个 token 的深度,后者优化的是每小时内容的 token 成本

OrcaRouter 的分析师 Alistair Wren 说得直白:「两个模型共享一个家族名和一个 1M 上下文窗口,但它们不是替代品,而是回答完全不同的问题。」

Agentic Perception:不是看完再想,是想好了再看

这是 Qwen3.8-Omni-Flash 最核心的技术亮点。

大多数视频理解模型的做法是:把整个视频从头到尾逐帧编码,然后问问题。如果一段 2 小时的视频里答案只出现在 3 分钟里,那 95% 的计算被浪费了。

Qwen 团队的做法是反过来:从问题出发,让模型决定看什么、听什么。它按照 coarse-to-fine 的多轮搜索策略逐步定位相关片段,只处理需要的那部分。

结果:

指标 逐帧处理 Agentic Perception 变化
OmniVideoBench 准确率 63.4 67.8 +4.4
每查询 tokens 消耗 145,736 79,117 -45.7%

又省 token 又提分——这在 AI 领域是罕见的「双重红利」。通常省计算就意味着牺牲质量,但 Agentic Perception 通过更智能的采样策略打破了这种权衡。

Benchmark:凭数据说话

Qwen 团队在 29 项评测上做了对比,相比上一代 Qwen3.5-Omni-Plus,平均提升超过 26%

文本与编码能力

评测项 Qwen3.8-Omni-Flash Qwen3.5-Omni-Plus 提升
Terminal-Bench 60.5 48.2 +12.3
LiveCodeBench 52.1 41.8 +10.3
IFBench 84.2 72.6 +11.6
GPQA Diamond 56.8 45.3 +11.5

多模态与感知能力

评测项 Qwen3.8-Omni-Flash Qwen3.5-Omni-Plus 对比 Gemini 3.8 Flash
WildClawBench-MM 71.0 34.5
AgenticVBench 82.1 59.8
UniClawBench 69.6
OmniVideoBench 67.8 58.2 接近
LongAudioSpan 63.5 55.2 接近
VoiceBench 91.6 超过

Qwen 团队特别指出:音频整体表现超过 Gemini 3.8 Flash,音视频综合性能接近。考虑到 1/5 的价格,这个成绩非常能打。

Agent 与工具调用

评测项 Qwen3.8-Omni-Flash 说明
WildClawBench-MM 71.0 +36.5 vs 前代
StreamingBench 80.8 流式 Agent 任务
AliMeeting DER 3.35 会议角色分离(越低越好)
AliMeeting CPWER 17.18 词错误率(越低越好)

AliMeeting 的数据对比最夸张:DER 从前代 88.11 降到 3.35——25 倍的改进,这已经不是「迭代」而是「换赛道」了。

🚀 最大亮点:WildClawBench-MM 提升 36.5 分,是全部评测中增幅最大的,也是 Agentic Perception 能力最直接的证明。

定价深度对比:1/5 不是全部故事

费率对比

费率项 Qwen3.8-Omni-Flash Gemini 3.8 Flash 倍数
输入 ($/M tokens) $0.15 $0.75 5x
输出 ($/M tokens) $0.47 $3.75 8x
缓存命中 ($/M tokens) $0.016 $0.03125 2x
音频输入(每小时) ~$0.36 比上代降 98%
音视频输入(每小时) ~$0.72 比上代降 93%
视频输入(每小时) ~$1.44 比上代降 89%

真正的冲击在媒体输入。Qwen 团队公布的数据显示,音频输入成本相比 Qwen3.5-Omni-Plus 下降了超过 98%,音视频输入下降 93%,视频输入下降 89%。

这意味着什么?

如果你在做音视频分析——会议转录、播客摘要、视频内容审核——Qwen3.8-Omni-Flash 极大降低了把「全量媒体输入」变成产品标配的成本门槛。以前只能在关键片段上做 AI 分析的场景,现在可以整段扔进去。

场景化成本对比

场景 每周用量 Qwen3.8-Omni-Flash Gemini 3.8 Flash 节省
客服通话分析(10 万通/周) ~200M tokens $30/周 $150/周 80%
视频内容审核(1000 小时/周) ~500M tokens $75/周 $375/周 80%
通用多模态推理(100 万次/周) ~300M tokens $45/周 $225/周 80%

上面的场景化计算基于输入为主的 workload,输出场景差距更大(8x)。

部署:六区域、OpenAI 协议、即开即用

Qwen3.8-Omni-Flash 目前是 API only,暂时没有开放权重。但部署支持很全面:

  • 六区域覆盖:北京、新加坡、香港、东京、法兰克福、弗吉尼亚
  • API 兼容:同时支持 DashScope 和 OpenAI 协议,无需改代码
  • 功能齐全:Function Calling、Web Search、Structured Outputs、Context Caching、Batch 全部支持
  • 视频输入:支持最多 2 小时/2GB 视频文件(通过 URL),15fps 稳定采样
  • 音频输入:支持最多 3 小时,113 种语言
  • 多声道:支持双声道立体声和四声道 FOA 空间音频

调用方式只需要几行 Python:

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url=os.environ["DASHSCOPE_BASE_URL"],
)
completion = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "video_url", "video_url": {"url": video_url}},
            {"type": "text", "text": "列出关键事件的时间戳。"},
        ]
    }],
    modalities=["text"],
)

默认为思考模式(reasoning_effort 默认 xhigh),可以关闭。

不止模型:开源工具链补全生态

Qwen 团队同步开源了两套工具:

Qwen-MM-Plugins(Apache-2.0):一套插件系统,让本地 Agent 框架(Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code、Gemini CLI)能直接调用 Omni 模型的多模态能力。核心功能包含:

  • omni-memory:构建音视频长期记忆
  • omni-video2note:把教程视频转成带图 PDF
  • omni-chatcut:音乐 MV 解说、电影评论、视频翻译

Qwen-Live Harness:开源的 Agent 能力评测框架,可复现 WildClawBench 等评测。

目前有一个已知缺口:本地 harness 还不能原生传递音频到主模型,音频需要通过 API 路由。README 已经标注了这个问题。

写在最后

Qwen3.8-Omni-Flash 的意义不止于「又一个便宜的多模态模型」。

它标志着一个转变:Flash 类模型的竞争从「堆参数」转向了「堆感知效率」。Agentic Perception 技术——让模型自己决定看什么——比单纯增加上下文窗口更有工程价值。因为它直接影响了使用成本曲线。

对于做音视频 AI 产品的团队来说,这个模型提供的不仅是 1/5 的价格,更是一个产品设计空间的打开:当「把整个视频扔进去分析」的成本低到可以忽略不计时,你能做哪些以前不敢做的功能?

这可能是今年多模态赛道上最重要的一次定价信号。

📌 延伸阅读:如果你对 Qwen 生态感兴趣,可以看看我上个月写的 《Qwen 3.8-27B 开源发布!》——那篇聊的是开源的 27B 推理模型,和今天的全模态 API 是同一个家族的不同分支。另外,《Google 拆分语音产品线!Gemini 3.8 Live 登顶语音排行榜》 可以帮你了解今天文章里的对比对象 Gemini Flash 的全貌。

By AI博士 万戈