Featured image of post Qwen 3.8-27B 开源发布!Apache 2.0 + 视觉理解 + 262K 上下文,Alibaba 这波太顶了!

Qwen 3.8-27B 开源发布!Apache 2.0 + 视觉理解 + 262K 上下文,Alibaba 这波太顶了!

如果你的团队正在找一个能在本地部署的多模态模型——能看图片、能看视频、能写代码、能玩 Agent——而且还得是开放许可,不担心商用风险。那你今天要记住一个名字:Qwen3.8-27B

昨天(2026 年 8 月 14 日 UTC 15:00),Alibaba 的 Qwen 团队在 Hugging Face 上正式发布了 Qwen3.8-27B 的权重文件。Apache 2.0 许可,27B 密集参数,262,144 tokens 原生上下文,自带视觉编码器,且支持视频理解。发布会当天社区评价出奇一致——「这是当前 30B 参数级别最令人信服的密集多模态本地可部署模型」。

Qwen3.8-27B 核心规格

先看硬指标:

维度 数值
参数量 27.78B(密集,非 MoE)
许可协议 Apache 2.0(开放权重)
上下文窗口 262,144 tokens 原生,可扩展至 1,000,000 tokens
最大输出 131,072 tokens
架构 Gated DeltaNet + Gated Attention 混合注意力(64 层中 48 层使用线性注意力)
视觉 原生图像 + 视频理解(Vision Encoder)
思考模式 默认开启,可调节 reasoning_effort(xhigh / medium / low)
猜测解码 内置 MTP(Multi-Token Prediction)draft head
推理格式 BF16 / FP8 官方,GGUF 第三方量化
部署 一块 Blackwell GPU 即可跑所有精度

这组数字里最让我兴奋的是架构。Qwen3.8-27B 用了 Gated DeltaNet 和 Gated Attention 的混合布局:64 层采用 3× (Gated DeltaNet → FFN) → 1× (Gated Attention → FFN) 的重复模式,每 4 层中 3 层是线性注意力。这意味着在 262K 超长上下文中,推理成本比纯 Softmax Attention 低得多。

Benchmark:全面碾压前代

Qwen 官方在模型卡中公布了一组详细的 Benchmark 对比数据,和自家前代 Qwen3.6-27B、同代 Qwen3.7-Plus、竞争对手 Muse Glimmer-30B 以及 Opus4.6 Max 做了横向对比。下面摘最关键的几项:

文本与编码能力

Benchmark Qwen3.8-27B Qwen3.6-27B 提升幅度
Terminal-Bench 2.1(终端 Agent 编码) 73.0 63.4 +9.6
SWE-bench Pro(软件工程) 61.7 53.5 +8.2
LiveCodeBench v6(竞技编码) 90.3 83.9 +6.4
DeepSWE 1.1(深度软件工程) 42.2 13.3 +28.9 🚀
NL2Repo-Bench(仓库级代码生成) 42.3 36.2 +6.1
QwenSWEBench(自研软件工程) 79.0 49.3 +29.7 🚀

DeepSWE 1.1 从 13.3 暴涨到 42.2——三倍提升。这不是渐进迭代,这是架构级的飞跃。QwenSWEBench 从 49.3 到 79.0 同样惊人。

Agent 与推理能力

Benchmark Qwen3.8-27B Qwen3.6-27B 提升幅度
CoWorkBench(长周期办公) 70.7 61.0 +9.7
JobBench(专业任务) 33.4 21.8 +11.6
Agents’ Last Exam Pass@1 20.4 10.6 +9.8 🚀
IFBench(指令遵循) 79.5 69.1 +10.4
GPQA Diamond(科学推理) 89.2 87.8 +1.4
HLE(多学科推理) 30.8 24.0 +6.8

Agents’ Last Exam 翻倍到 20.4%,IFBench 首次突破 79 分,这些指标对 Agent 开发者来说意义重大——模型越能精准理解指令和自主规划,越适合放入 Agent 循环。

多模态与计算机使用

Benchmark Qwen3.8-27B Qwen3.6-27B 提升幅度
OSWorld-Verified(计算机使用) 84.3 63.9 +20.4 🚀
WebArena-Verified(浏览器使用) 64.8 48.8 +16.0 🚀
AndroidWorld(移动端使用) 81.9 70.3 +11.6
SWE-MM(多模态软件工程) 38.6 25.7 +12.9
Vision2Web(视觉 Web 开发) 62.9 45.0 +17.9 🚀
MathVision w/o CI(视觉数学) 90.0 85.1 +4.9
RealWorldQA(真实世界感知) 85.9 84.1 +1.8
OmniDocBench 1.5(文档理解) 91.1 89.4 +1.7

OSWorld-Verified 从 63.9 到 84.3,WebArena 从 48.8 到 64.8——这意味着 Qwen3.8-27B 的「计算机视觉 + Agent 规划」能力已经接近甚至超越了一些大十倍的闭源模型。对一个能在本地部署的 27B 开源模型来说,这是恐怖级别的表现。

定价与部署:一块 Blackwell 就够了

在 OpenRouter 上,Qwen3.8-27B 的 API 定价已经公布:

项目 价格
输入 tokens $0.45 / M tokens
输出 tokens $3.20 / M tokens
上下文 262,144 tokens

对比一下昨天写的 Grok 4.6($2/$8 每百万 tokens),Qwen3.8-27B 的 API 定价明显更低,而且还能自己部署——这是开源模型最大的优势。

vLLM Recipes 上已经有了完整的部署配置:H200 单卡 BF16 即可流畅推理,Blackwell B200 上一块 GPU 就能跑所有精度。NVFP4 量化仅需 24.6 GiB VRAM,在 1M 扩展上下文下还能容纳 6.6M KV tokens

vllm serve Qwen/Qwen3.8-27B \
  --tensor-parallel-size 1 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --reasoning-parser qwen3 \
  --mm-encoder-tp-mode data

支持框架包括 Hugging Face Transformers、vLLM ≥ 0.17.0、SGLang、TokenSpeed。GGUF 量化版本也已由社区提供,意味着 LM Studio、Ollama、llama.cpp 用户都能直接跑。

混合注意力架构:为什么这是关键创新

Qwen3.8-27B 最大的技术亮点不是参数数量,而是Gated DeltaNet + Gated Attention 混合架构

传统 Transformer 的 Softmax Attention 在长上下文下成本呈二次增长。Gated DeltaNet 是一种线性注意力变体——它把注意力计算从 O(n²) 降到了 O(n),同时用门控机制(Gating)保留了选择性遗忘/写入能力,避免纯线性注意力「什么都记、什么也记不好」的问题。

64 层中 48 层用 DeltaNet(线性)、16 层用 Gated Attention(标准),让模型在超长文档理解和精确信息检索之间取得平衡。不是「全都要」,而是「该快的快、该准的准」。

这种设计不是 Qwen 首创,但 Qwen3.8-27B 是第一个在 27B 开源多模态模型 上成功落地的。对开发者来说,这意味着你可以丢一整本书或者一整个代码仓库进去,而不必担心 64K 之后就开始遗忘。

写在最后

Qwen3.8-27B 的发布,让我想起了 2025 年初 DeepSeek V2 开源时的场景——一个「不够大但足够好」的开源模型,在关键能力上逼近甚至超越比自己大 10 倍以上的闭源模型。

Apache 2.0 许可消除了商用顾虑。一块 Blackwell GPU 就能全精度部署。262K 原生上下文让 Agent 开发者可以真正跑「读完整份代码库再改 bug」的任务。SWE-bench Pro 61.7 和 Terminal-Bench 73.0 的得分说明,它已经是一个合格的编码助手模型。

Alibaba 的 Qwen 团队在 Hugging Face 上已经积累了 97,300 粉丝,Qwen3.8-27B 发布 24 小时内获得 9,430 个赞。社区对它的热情不是没有道理的。如果你最近在选一个能本地部署的多模态模型——从 Agent 编程到文档分析到计算机自动化——Qwen3.8-27B 应该出现在你的候选列表的第一行。

📌 延伸阅读:Grok 4.6 横空出世!500K 上下文 + $2/百万 tokens — 闭源阵营的性价比反击,两篇一起读能看清 2026 下半年开源 vs 闭源的定价战全景。

By AI博士 万戈