<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>视觉语言模型 on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/%E8%A7%86%E8%A7%89%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Sat, 15 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/%E8%A7%86%E8%A7%89%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Qwen 3.8-27B 开源发布！Apache 2.0 &#43; 视觉理解 &#43; 262K 上下文，Alibaba 这波太顶了！</title>
        <link>https://www.yesmiracle.net/post/20260815-qwen3-8-27b-open-source-release/</link>
        <pubDate>Sat, 15 Aug 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260815-qwen3-8-27b-open-source-release/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260815-qwen3-8-27b-open-source-release/cover.svg" alt="Featured image of post Qwen 3.8-27B 开源发布！Apache 2.0 &#43; 视觉理解 &#43; 262K 上下文，Alibaba 这波太顶了！" /&gt;&lt;p&gt;如果你的团队正在找一个能在本地部署的多模态模型——能看图片、能看视频、能写代码、能玩 Agent——而且还得是开放许可，不担心商用风险。那你今天要记住一个名字：&lt;strong&gt;Qwen3.8-27B&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;昨天（2026 年 8 月 14 日 UTC 15:00），Alibaba 的 Qwen 团队在 Hugging Face 上正式发布了 Qwen3.8-27B 的权重文件。Apache 2.0 许可，27B 密集参数，&lt;strong&gt;262,144 tokens 原生上下文&lt;/strong&gt;，自带视觉编码器，且支持视频理解。发布会当天社区评价出奇一致——「这是当前 30B 参数级别最令人信服的密集多模态本地可部署模型」。&lt;/p&gt;
&lt;h2 id=&#34;qwen38-27b-核心规格&#34;&gt;Qwen3.8-27B 核心规格&lt;/h2&gt;
&lt;p&gt;先看硬指标：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th&gt;数值&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;参数量&lt;/td&gt;
          &lt;td&gt;27.78B（密集，非 MoE）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;许可协议&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;Apache 2.0&lt;/strong&gt;（开放权重）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;上下文窗口&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;262,144 tokens&lt;/strong&gt; 原生，可扩展至 &lt;strong&gt;1,000,000&lt;/strong&gt; tokens&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;最大输出&lt;/td&gt;
          &lt;td&gt;131,072 tokens&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;架构&lt;/td&gt;
          &lt;td&gt;Gated DeltaNet + Gated Attention 混合注意力（64 层中 48 层使用线性注意力）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;视觉&lt;/td&gt;
          &lt;td&gt;原生图像 + 视频理解（Vision Encoder）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;思考模式&lt;/td&gt;
          &lt;td&gt;默认开启，可调节 &lt;code&gt;reasoning_effort&lt;/code&gt;（xhigh / medium / low）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;猜测解码&lt;/td&gt;
          &lt;td&gt;内置 MTP（Multi-Token Prediction）draft head&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;推理格式&lt;/td&gt;
          &lt;td&gt;BF16 / FP8 官方，GGUF 第三方量化&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;部署&lt;/td&gt;
          &lt;td&gt;一块 Blackwell GPU 即可跑所有精度&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这组数字里最让我兴奋的是&lt;strong&gt;架构&lt;/strong&gt;。Qwen3.8-27B 用了 Gated DeltaNet 和 Gated Attention 的混合布局：64 层采用 &lt;code&gt;3× (Gated DeltaNet → FFN) → 1× (Gated Attention → FFN)&lt;/code&gt; 的重复模式，每 4 层中 3 层是线性注意力。这意味着在 262K 超长上下文中，推理成本比纯 Softmax Attention 低得多。&lt;/p&gt;
&lt;h2 id=&#34;benchmark全面碾压前代&#34;&gt;Benchmark：全面碾压前代&lt;/h2&gt;
&lt;p&gt;Qwen 官方在模型卡中公布了一组详细的 Benchmark 对比数据，和自家前代 Qwen3.6-27B、同代 Qwen3.7-Plus、竞争对手 Muse Glimmer-30B 以及 Opus4.6 Max 做了横向对比。下面摘最关键的几项：&lt;/p&gt;
&lt;h3 id=&#34;文本与编码能力&#34;&gt;文本与编码能力&lt;/h3&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;Benchmark&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.8-27B&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.6-27B&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;提升幅度&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Terminal-Bench 2.1（终端 Agent 编码）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;73.0&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;63.4&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+9.6&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;SWE-bench Pro（软件工程）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;61.7&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;53.5&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+8.2&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;LiveCodeBench v6（竞技编码）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;90.3&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;83.9&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+6.4&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;DeepSWE 1.1（深度软件工程）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;42.2&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;13.3&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+28.9&lt;/strong&gt; 🚀&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;NL2Repo-Bench（仓库级代码生成）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;42.3&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;36.2&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+6.1&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;QwenSWEBench（自研软件工程）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;79.0&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;49.3&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+29.7&lt;/strong&gt; 🚀&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;DeepSWE 1.1 从 13.3 暴涨到 &lt;strong&gt;42.2&lt;/strong&gt;——三倍提升。这不是渐进迭代，这是架构级的飞跃。QwenSWEBench 从 49.3 到 79.0 同样惊人。&lt;/p&gt;
&lt;h3 id=&#34;agent-与推理能力&#34;&gt;Agent 与推理能力&lt;/h3&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;Benchmark&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.8-27B&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.6-27B&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;提升幅度&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;CoWorkBench（长周期办公）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;70.7&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;61.0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+9.7&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;JobBench（专业任务）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;33.4&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;21.8&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+11.6&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Agents&amp;rsquo; Last Exam Pass@1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;20.4&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;10.6&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+9.8&lt;/strong&gt; 🚀&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;IFBench（指令遵循）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;79.5&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;69.1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+10.4&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;GPQA Diamond（科学推理）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;89.2&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;87.8&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+1.4&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;HLE（多学科推理）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;30.8&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;24.0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+6.8&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Agents&amp;rsquo; Last Exam 翻倍到 20.4%，IFBench 首次突破 79 分，这些指标对 Agent 开发者来说意义重大——模型越能精准理解指令和自主规划，越适合放入 Agent 循环。&lt;/p&gt;
&lt;h3 id=&#34;多模态与计算机使用&#34;&gt;多模态与计算机使用&lt;/h3&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;Benchmark&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.8-27B&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Qwen3.6-27B&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;提升幅度&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;OSWorld-Verified（计算机使用）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;84.3&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;63.9&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+20.4&lt;/strong&gt; 🚀&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;WebArena-Verified（浏览器使用）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;64.8&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;48.8&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+16.0&lt;/strong&gt; 🚀&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;AndroidWorld（移动端使用）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;81.9&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;70.3&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+11.6&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;SWE-MM（多模态软件工程）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;38.6&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;25.7&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+12.9&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Vision2Web（视觉 Web 开发）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;62.9&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;45.0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+17.9&lt;/strong&gt; 🚀&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;MathVision w/o CI（视觉数学）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;90.0&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;85.1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+4.9&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;RealWorldQA（真实世界感知）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;85.9&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;84.1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+1.8&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;OmniDocBench 1.5（文档理解）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;91.1&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;89.4&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+1.7&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;OSWorld-Verified 从 63.9 到 84.3，WebArena 从 48.8 到 64.8——这意味着 Qwen3.8-27B 的「计算机视觉 + Agent 规划」能力已经接近甚至超越了一些大十倍的闭源模型。对一个能在本地部署的 27B 开源模型来说，这是恐怖级别的表现。&lt;/p&gt;
&lt;h2 id=&#34;定价与部署一块-blackwell-就够了&#34;&gt;定价与部署：一块 Blackwell 就够了&lt;/h2&gt;
&lt;p&gt;在 OpenRouter 上，Qwen3.8-27B 的 API 定价已经公布：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;项目&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;价格&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;输入 tokens&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.45 / M tokens&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输出 tokens&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$3.20 / M tokens&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;上下文&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;262,144 tokens&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;对比一下&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260814-grok-4-6-launch-pricing-benchmarks/&#34; &gt;昨天写的 Grok 4.6&lt;/a&gt;（$2/$8 每百万 tokens），Qwen3.8-27B 的 API 定价明显更低，而且还能&lt;strong&gt;自己部署&lt;/strong&gt;——这是开源模型最大的优势。&lt;/p&gt;
&lt;p&gt;vLLM Recipes 上已经有了完整的部署配置：H200 单卡 BF16 即可流畅推理，Blackwell B200 上一块 GPU 就能跑所有精度。NVFP4 量化仅需 &lt;strong&gt;24.6 GiB&lt;/strong&gt; VRAM，在 1M 扩展上下文下还能容纳 &lt;strong&gt;6.6M KV tokens&lt;/strong&gt;。&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;vllm serve Qwen/Qwen3.8-27B &lt;span style=&#34;color:#ae81ff&#34;&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#ae81ff&#34;&gt;&lt;/span&gt;  --tensor-parallel-size &lt;span style=&#34;color:#ae81ff&#34;&gt;1&lt;/span&gt; &lt;span style=&#34;color:#ae81ff&#34;&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#ae81ff&#34;&gt;&lt;/span&gt;  --enable-auto-tool-choice &lt;span style=&#34;color:#ae81ff&#34;&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#ae81ff&#34;&gt;&lt;/span&gt;  --tool-call-parser qwen3_coder &lt;span style=&#34;color:#ae81ff&#34;&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#ae81ff&#34;&gt;&lt;/span&gt;  --reasoning-parser qwen3 &lt;span style=&#34;color:#ae81ff&#34;&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#ae81ff&#34;&gt;&lt;/span&gt;  --mm-encoder-tp-mode data
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;支持框架包括 Hugging Face Transformers、vLLM ≥ 0.17.0、SGLang、TokenSpeed。GGUF 量化版本也已由社区提供，意味着 LM Studio、Ollama、llama.cpp 用户都能直接跑。&lt;/p&gt;
&lt;h2 id=&#34;混合注意力架构为什么这是关键创新&#34;&gt;混合注意力架构：为什么这是关键创新&lt;/h2&gt;
&lt;p&gt;Qwen3.8-27B 最大的技术亮点不是参数数量，而是&lt;strong&gt;Gated DeltaNet + Gated Attention 混合架构&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;传统 Transformer 的 Softmax Attention 在长上下文下成本呈二次增长。Gated DeltaNet 是一种线性注意力变体——它把注意力计算从 O(n²) 降到了 O(n)，同时用门控机制（Gating）保留了选择性遗忘/写入能力，避免纯线性注意力「什么都记、什么也记不好」的问题。&lt;/p&gt;
&lt;p&gt;64 层中 &lt;strong&gt;48 层用 DeltaNet（线性）、16 层用 Gated Attention（标准）&lt;/strong&gt;，让模型在超长文档理解和精确信息检索之间取得平衡。不是「全都要」，而是「该快的快、该准的准」。&lt;/p&gt;
&lt;p&gt;这种设计不是 Qwen 首创，但 Qwen3.8-27B 是第一个在 &lt;strong&gt;27B 开源多模态模型&lt;/strong&gt; 上成功落地的。对开发者来说，这意味着你可以丢一整本书或者一整个代码仓库进去，而不必担心 64K 之后就开始遗忘。&lt;/p&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;
&lt;p&gt;Qwen3.8-27B 的发布，让我想起了 2025 年初 DeepSeek V2 开源时的场景——一个「不够大但足够好」的开源模型，在关键能力上逼近甚至超越比自己大 10 倍以上的闭源模型。&lt;/p&gt;
&lt;p&gt;Apache 2.0 许可消除了商用顾虑。一块 Blackwell GPU 就能全精度部署。262K 原生上下文让 Agent 开发者可以真正跑「读完整份代码库再改 bug」的任务。SWE-bench Pro 61.7 和 Terminal-Bench 73.0 的得分说明，它已经是一个合格的编码助手模型。&lt;/p&gt;
&lt;p&gt;Alibaba 的 Qwen 团队在 Hugging Face 上已经积累了 &lt;strong&gt;97,300 粉丝&lt;/strong&gt;，Qwen3.8-27B 发布 24 小时内获得 &lt;strong&gt;9,430 个赞&lt;/strong&gt;。社区对它的热情不是没有道理的。如果你最近在选一个能本地部署的多模态模型——从 Agent 编程到文档分析到计算机自动化——Qwen3.8-27B 应该出现在你的候选列表的第一行。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;📌 延伸阅读：&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260814-grok-4-6-launch-pricing-benchmarks/&#34; &gt;Grok 4.6 横空出世！500K 上下文 + $2/百万 tokens&lt;/a&gt; — 闭源阵营的性价比反击，两篇一起读能看清 2026 下半年开源 vs 闭源的定价战全景。&lt;/p&gt;&lt;/blockquote&gt;
</description>
        </item>
        
    </channel>
</rss>
