Featured image of post DeepSeek V4.1 Flash 来了!开源模型狠揍 GPT-5.6 Sol,MIT 协议 + 1M 上下文只要 $0.15

DeepSeek V4.1 Flash 来了!开源模型狠揍 GPT-5.6 Sol,MIT 协议 + 1M 上下文只要 $0.15

如果你关注开源模型的进展,昨天 DeepSeek 扔出了一颗重磅炸弹——V4.1 Flash。这不仅仅是一个新版本号,而是一次架构、定价和定位的三重跳升:一个 MIT 协议可下载、552B 参数但仅激活 8B、1M 上下文窗口的开源模型,在五项最难的 Agent 评测上全部干翻 GPT-5.6 Sol 和 Claude Opus 5。

更炸裂的是,DeepSeek 宣布将在 9 月 14 日退役 V4 Pro(之前卖 $1/$4 的旗舰)。所有 Pro 流量直接路由到 V4.1 Flash,按 Flash 的价格计费。一个开源模型,成了 DeepSeek 事实上的新旗舰。

架构拆解:Causal Encoder-Decoder + 890 字节 KV 缓存

V4.1 Flash 的架构可能是今年最被低估的创新。它采用了Causal Encoder-Decoder(CED)设计:40 层 Transformer 被拆成 20 层因果编码器 + 20 层解码器,解码器的全局 KV 缓存从编码器最终隐藏态投影而来,不再逐层重建。

配合 Compressed Sparse Attention 2(CSA2) 和 FP4 KV 缓存(E2M1 格式),全局 KV 缓存压缩到 890 字节/token——只有 V4 Flash 的四分之一,V1 版本的四百分之一。一个 SWA Bounded Replay 技术进一步把持久 KV 缓存足迹降到 V4 Flash 的八分之一。

模型还内置了一个 196B 参数的 conditional memory 模块(Engram),通过 token-based lookup 稀疏访问。每个 MoE 层有 1 个共享 expert + 384 个路由 expert,每 token 激活 6 个路由 expert。

训练数据:从零开始训了 45T tokens,在 34T 标记时将上下文扩展到 1M。后训练使用标准的 SFT + RL + on-policy distillation。

工程意义上的核心数字

参数
backbone 参数 552B
预填充激活 8B/token
解码激活 16B/token
上下文窗口 1,048,576 tokens
最大输出 384,000 tokens
KV 缓存 890 bytes/token
权重许可 MIT
多模态 原生图片 + 文本输入

评测成绩:五项全胜,开源模型首次登顶

按照 DeepSeek 官方模型卡在最大推理 effort 下的数据,V4.1 Flash 在五个关键 Agent 评测上同时击败 GPT-5.6 Sol 和 Claude Opus 5:

评测 GPT-5.6 Sol Claude Opus 5.0 DeepSeek V4.1 Flash
DeepSWE v1.1(真实 GitHub issue 修复) 73.0 74.0 74.2 🚀
Terminal-Bench 2.1(终端任务) 88.8 89.1 90.6 🚀
AutomationBench(工作流自动化) 45.8 50.3 54.8 🚀
Agent’s Last Exam(Agent 推理) 26.7 28.6 31.8 🚀
CyberGym(网络安全任务) 84.5 N/R 88.1 🚀
HLE with tools(综合) N/R 63.6 63.9
Terminal-Bench 4.0(长 horizon) 39.9 51.8 31.2
ProgramBench Almost@1(编程) 23.0 37.0 20.3
NL2Repo-Bench(仓库级编码) 56.8 75.3 64.0

五项全胜,包括含金量极高的 DeepSWE(真实 GitHub issue)和 Terminal-Bench 2.1(终端操作)。

不过三个短板也值得关注:Terminal-Bench 4.0(长 horizon 任务)只有 31.2,远低于 Opus 5 的 51.8——说明长时间序列的复杂编排仍不是它的强项。ProgramBenchNL2Repo-Bench 也被 Opus 5 拉开较大差距。V4.1 Flash 的强项集中在 短 Horizon、高吞吐的 Agent 工作流,而非深度推理或超长序列规划。

Codeforces 评分从 V4 Pro 的 3348 上升到 3471,MathArena Apex 上 65.6 追平 Kimi K3。

定价掀桌:比 Sol 便宜几倍,还直接废掉自家 V4 Pro

V4.1 Flash 的定价策略值得单独说。它不是简单的「新模型降价」,而是直接把旗舰产品退役了:

价格类型 峰值(中国白天) 非峰值
输入(cache miss) $0.30/M $0.15/M
输入(cache hit) $0.006/M $0.003/M
输出 $1.20/M $0.60/M

对比 GPT-5.6 Sol($10/$50)和 Claude Opus 5($10/$50),V4.1 Flash 的推理成本只有它们的 1/30 到 1/80。即使和自家已降价的 V4 Pro 比($1/$4),也是 3-6 倍的价差。

非峰值 $0.15/$0.60 的价格对于北美和欧洲开发者来说尤其香——换算下来一天 24 小时里大多数开发时段都在非峰值窗口内。Cache hit 价格 $0.003 意味着运行 Agent 循环(反复读取 500K 上下文)的单次成本几乎可以忽略。

最狠的一招:9 月 14 日起,请求 deepseek-v4-pro 会自动路由到 V4.1 Flash,按 Flash 价格计费。DeepSeek 官方说:「V4.1 Flash 已经在性能、成本、速度和任务完成时间上全面超越 V4 Pro。」——自己淘汰自己上代旗舰,这在模型公司里相当罕见。

开源的意义:Agent 专属推理引擎

V4.1 Flash 的 MIT 协议意味着你可以:

  • 下载权重自行部署(单卡可以通过量化跑起来吗?——8B 激活参数,理论可行)
  • 在 vLLM、SGLang 等框架上 serve
  • 微调出自己的 Agent 专用版本
  • 不用被任何 API 供应商标记数据用于训练

CED 架构的另一个隐含价值是推理经济性。Agent 工作流是输入密集型:一个编码 Agent 每步都可能重读整个上下文。890 bytes/token 的 KV 缓存 + 8B 激活参数,让长上下文重读的成本几乎不增长。对跑 Agent 循环的团队来说,这是架构层面的降维打击。

写在最后

DeepSeek V4.1 Flash 是这个月第三款「让开源模型重获信心」的发布(前有 Meta Muse Spark、Qwen 3.8 系列)。但它的 CED 架构设计和 V4 Pro 自裁式退役,释放了比评测分数更强烈的信号:开源模型的成本曲线正加速逼近甚至低于闭源模型的推理成本线。

如果这个趋势持续——8B 激活就能跑赢 100B+ 级闭源模型在 Agent 场景下的表现——那明年部署 AI Agent 时,「是否自建推理」可能不再是选择题,而是默认选项。

📌 延伸阅读《GPT-6 Astra 横空出世!》 — GPT-6 Astra 的 Agent 能力与 Sol 的对比分析

By AI博士 万戈