如果你的团队正在找一个能在本地部署的多模态模型——能看图片、能看视频、能写代码、能玩 Agent——而且还得是开放许可,不担心商用风险。那你今天要记住一个名字:Qwen3.8-27B。
昨天(2026 年 8 月 14 日 UTC 15:00),Alibaba 的 Qwen 团队在 Hugging Face 上正式发布了 Qwen3.8-27B 的权重文件。Apache 2.0 许可,27B 密集参数,262,144 tokens 原生上下文,自带视觉编码器,且支持视频理解。发布会当天社区评价出奇一致——「这是当前 30B 参数级别最令人信服的密集多模态本地可部署模型」。
Qwen3.8-27B 核心规格
先看硬指标:
| 维度 | 数值 |
|---|---|
| 参数量 | 27.78B(密集,非 MoE) |
| 许可协议 | Apache 2.0(开放权重) |
| 上下文窗口 | 262,144 tokens 原生,可扩展至 1,000,000 tokens |
| 最大输出 | 131,072 tokens |
| 架构 | Gated DeltaNet + Gated Attention 混合注意力(64 层中 48 层使用线性注意力) |
| 视觉 | 原生图像 + 视频理解(Vision Encoder) |
| 思考模式 | 默认开启,可调节 reasoning_effort(xhigh / medium / low) |
| 猜测解码 | 内置 MTP(Multi-Token Prediction)draft head |
| 推理格式 | BF16 / FP8 官方,GGUF 第三方量化 |
| 部署 | 一块 Blackwell GPU 即可跑所有精度 |
这组数字里最让我兴奋的是架构。Qwen3.8-27B 用了 Gated DeltaNet 和 Gated Attention 的混合布局:64 层采用 3× (Gated DeltaNet → FFN) → 1× (Gated Attention → FFN) 的重复模式,每 4 层中 3 层是线性注意力。这意味着在 262K 超长上下文中,推理成本比纯 Softmax Attention 低得多。
Benchmark:全面碾压前代
Qwen 官方在模型卡中公布了一组详细的 Benchmark 对比数据,和自家前代 Qwen3.6-27B、同代 Qwen3.7-Plus、竞争对手 Muse Glimmer-30B 以及 Opus4.6 Max 做了横向对比。下面摘最关键的几项:
文本与编码能力
| Benchmark | Qwen3.8-27B | Qwen3.6-27B | 提升幅度 |
|---|---|---|---|
| Terminal-Bench 2.1(终端 Agent 编码) | 73.0 | 63.4 | +9.6 |
| SWE-bench Pro(软件工程) | 61.7 | 53.5 | +8.2 |
| LiveCodeBench v6(竞技编码) | 90.3 | 83.9 | +6.4 |
| DeepSWE 1.1(深度软件工程) | 42.2 | 13.3 | +28.9 🚀 |
| NL2Repo-Bench(仓库级代码生成) | 42.3 | 36.2 | +6.1 |
| QwenSWEBench(自研软件工程) | 79.0 | 49.3 | +29.7 🚀 |
DeepSWE 1.1 从 13.3 暴涨到 42.2——三倍提升。这不是渐进迭代,这是架构级的飞跃。QwenSWEBench 从 49.3 到 79.0 同样惊人。
Agent 与推理能力
| Benchmark | Qwen3.8-27B | Qwen3.6-27B | 提升幅度 |
|---|---|---|---|
| CoWorkBench(长周期办公) | 70.7 | 61.0 | +9.7 |
| JobBench(专业任务) | 33.4 | 21.8 | +11.6 |
| Agents’ Last Exam Pass@1 | 20.4 | 10.6 | +9.8 🚀 |
| IFBench(指令遵循) | 79.5 | 69.1 | +10.4 |
| GPQA Diamond(科学推理) | 89.2 | 87.8 | +1.4 |
| HLE(多学科推理) | 30.8 | 24.0 | +6.8 |
Agents’ Last Exam 翻倍到 20.4%,IFBench 首次突破 79 分,这些指标对 Agent 开发者来说意义重大——模型越能精准理解指令和自主规划,越适合放入 Agent 循环。
多模态与计算机使用
| Benchmark | Qwen3.8-27B | Qwen3.6-27B | 提升幅度 |
|---|---|---|---|
| OSWorld-Verified(计算机使用) | 84.3 | 63.9 | +20.4 🚀 |
| WebArena-Verified(浏览器使用) | 64.8 | 48.8 | +16.0 🚀 |
| AndroidWorld(移动端使用) | 81.9 | 70.3 | +11.6 |
| SWE-MM(多模态软件工程) | 38.6 | 25.7 | +12.9 |
| Vision2Web(视觉 Web 开发) | 62.9 | 45.0 | +17.9 🚀 |
| MathVision w/o CI(视觉数学) | 90.0 | 85.1 | +4.9 |
| RealWorldQA(真实世界感知) | 85.9 | 84.1 | +1.8 |
| OmniDocBench 1.5(文档理解) | 91.1 | 89.4 | +1.7 |
OSWorld-Verified 从 63.9 到 84.3,WebArena 从 48.8 到 64.8——这意味着 Qwen3.8-27B 的「计算机视觉 + Agent 规划」能力已经接近甚至超越了一些大十倍的闭源模型。对一个能在本地部署的 27B 开源模型来说,这是恐怖级别的表现。
定价与部署:一块 Blackwell 就够了
在 OpenRouter 上,Qwen3.8-27B 的 API 定价已经公布:
| 项目 | 价格 |
|---|---|
| 输入 tokens | $0.45 / M tokens |
| 输出 tokens | $3.20 / M tokens |
| 上下文 | 262,144 tokens |
对比一下昨天写的 Grok 4.6($2/$8 每百万 tokens),Qwen3.8-27B 的 API 定价明显更低,而且还能自己部署——这是开源模型最大的优势。
vLLM Recipes 上已经有了完整的部署配置:H200 单卡 BF16 即可流畅推理,Blackwell B200 上一块 GPU 就能跑所有精度。NVFP4 量化仅需 24.6 GiB VRAM,在 1M 扩展上下文下还能容纳 6.6M KV tokens。
vllm serve Qwen/Qwen3.8-27B \
--tensor-parallel-size 1 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--mm-encoder-tp-mode data
支持框架包括 Hugging Face Transformers、vLLM ≥ 0.17.0、SGLang、TokenSpeed。GGUF 量化版本也已由社区提供,意味着 LM Studio、Ollama、llama.cpp 用户都能直接跑。
混合注意力架构:为什么这是关键创新
Qwen3.8-27B 最大的技术亮点不是参数数量,而是Gated DeltaNet + Gated Attention 混合架构。
传统 Transformer 的 Softmax Attention 在长上下文下成本呈二次增长。Gated DeltaNet 是一种线性注意力变体——它把注意力计算从 O(n²) 降到了 O(n),同时用门控机制(Gating)保留了选择性遗忘/写入能力,避免纯线性注意力「什么都记、什么也记不好」的问题。
64 层中 48 层用 DeltaNet(线性)、16 层用 Gated Attention(标准),让模型在超长文档理解和精确信息检索之间取得平衡。不是「全都要」,而是「该快的快、该准的准」。
这种设计不是 Qwen 首创,但 Qwen3.8-27B 是第一个在 27B 开源多模态模型 上成功落地的。对开发者来说,这意味着你可以丢一整本书或者一整个代码仓库进去,而不必担心 64K 之后就开始遗忘。
写在最后
Qwen3.8-27B 的发布,让我想起了 2025 年初 DeepSeek V2 开源时的场景——一个「不够大但足够好」的开源模型,在关键能力上逼近甚至超越比自己大 10 倍以上的闭源模型。
Apache 2.0 许可消除了商用顾虑。一块 Blackwell GPU 就能全精度部署。262K 原生上下文让 Agent 开发者可以真正跑「读完整份代码库再改 bug」的任务。SWE-bench Pro 61.7 和 Terminal-Bench 73.0 的得分说明,它已经是一个合格的编码助手模型。
Alibaba 的 Qwen 团队在 Hugging Face 上已经积累了 97,300 粉丝,Qwen3.8-27B 发布 24 小时内获得 9,430 个赞。社区对它的热情不是没有道理的。如果你最近在选一个能本地部署的多模态模型——从 Agent 编程到文档分析到计算机自动化——Qwen3.8-27B 应该出现在你的候选列表的第一行。
📌 延伸阅读:Grok 4.6 横空出世!500K 上下文 + $2/百万 tokens — 闭源阵营的性价比反击,两篇一起读能看清 2026 下半年开源 vs 闭源的定价战全景。