Featured image of post IBM 开源 Granite 4.2!Apache 2.0 原生推理模型,30B 跑 SWE-Bench 57%,Agent 能力全下放!

IBM 开源 Granite 4.2!Apache 2.0 原生推理模型,30B 跑 SWE-Bench 57%,Agent 能力全下放!

你有没有注意到,2026 年下半年的开放权重模型战场变了?

前两年大家比的是「聊天好不好用」、「能不能写诗写代码」。但到了今天,OpenAI、Anthropic、Google 的闭源模型在纯聊天质量上已经把门槛推到了肉眼看不见的高度,开放权重模型再追同一件事已经没有意义。

所以新的战场出现了:可靠的工具调用、软件工程能力、以及经得起真实工作负载考验的推理能力。

昨天(8 月 25 日),IBM 在 Hugging Face 上静悄悄地发布了 Granite 4.2——一个专门面向 Agent 工作负载的开放权重模型家族。它不追聊天质量,不打 MoE 规模战,而是带着一套全新的训练管线,在 Apache 2.0 许可证下给了社区三颗阻挡不住的子弹:3B、8B、30B。

而最让人兴奋的,不是它有多大,而是它把「推理」和「Agent」能力做成了原生功能,而不是靠额外 Prompt 钩上去的。

Granite 4.2:三个尺寸,一个设计哲学

先来看看全家福:

型号 参数 层数 隐藏层维度 MLP 维度 Agentic RL 许可证
Granite 4.2 3B 3B 40 2560 8192 Apache 2.0
Granite 4.2 8B 8B 40 4096 12800 Apache 2.0
Granite 4.2 30B 30B 64 4096 32768 Apache 2.0

三个模型都是纯密集(Dense)Transformer 架构,没有使用 MoE。这是 IBM 的一个明确选择:密集架构的推理行为更可预测,部署边界更清晰,不像 MoE 模型那样「显存没算对就炸了」。

所有模型支持 131,072 tokens 上下文窗口(预训练阶段扩展到 512K,实际部署时以 served context 为准)。相比 Granite 4.1,4.2 最大的变化不是参数规模,而是训练管线——从「指令跟随」全面转向「推理原生」。

Agentic RL 管线:在真实沙箱里「学干活」

这是 Granite 4.2 最有意思的部分。8B 和 30B 的训练不再止步于 SFT + RLHF,而是进入了一个多阶段、多环境的强化学习管道

  1. SFT — 约 720 万样本,100B tokens 的监督微调
  2. Foundational RL (RLVR) — 数学、科学、编程、推理、工具调用全覆盖
  3. Skill Boosters — 指令跟随增强、代码能力增强
  4. SWE Stage 1 — 128K 上下文,单轮软件工程 rollout
  5. SWE Stage 2 — 128K 上下文,多轮沙箱 rollout(最多 128 个环境交互轮次)
  6. Terminal RL — 64K 上下文,终端操作(最多 64 轮)
  7. Search RL — 128K 上下文,Web 搜索与信息检索(最多 64 轮)
  8. RLHF — 最终偏好对齐

每一阶段都是独立的异步 GRPO 训练,从前一阶段 checkpoint 热启动。训练数据来自 OpenHands、OpenCode、Terminus-2、SWE-agent、OpenResearcher、甚至 Hermes 等 Agent 框架的沙箱轨迹。

值得注意的是:3B 模型没有经过 Agentic RL 阶段。 这不是疏忽,而是设计选择——IBM 认为 3B 的容量不足以从多轮工具调用轨迹中学习,同样的算力投到 8B 和 30B 上回报更高。这解释了为什么 3B 在 Agent 评测上完全没有分数。

Benchmark 数据:密集模型的正面硬刚

IBM 公布的评测数据是最直观的定位工具:

评测基准 3B 8B 30B
SWE-Bench Verified 47.67 57.00
Terminal-Bench 2.1 20.56 29.24
tau3-bench 50.99 66.34 68.05
BFCL v4 (函数调用) 52.41 50.29 61.39
AIME25 (数学推理) 78.33 86.67 89.17
GPQA (研究生科学) 54.80 64.14 66.41
MMLU-Pro 67.84 74.04 77.60
RULER 128K (长上下文) 55.30 71.41 81.38

三个关键洞察:

第一,SWE-Bench Verified 57.00 是 30B 开放权重模型里极具竞争力的水平。它在真实 GitHub issue 上评测——不是代码补全,是修 bug、加功能、改测试。对比同等规模的竞品,这个成绩意味着你可以在单台 A100/H100 上部署一个能真正干活的编码 Agent。

第二,8B 和 30B 之间的 Agent 差距,远小于 3B 和 8B 之间的悬崖。 8B 的 SWE-Bench 47.67 已经足够做实际的编码 Agent 工作,而 3B 直接没有分数。如果你的团队需要 Agent 能力、只有单卡预算,8B 是最小的选择。

第三,在纯推理能力上,30B 不是最高的。 DeepSeek V4、Qwen 3.6、GLM 5.2 在 100B+ 参数规模下都有更高的 AIME25/MMLU-Pro 分数。Granite 4.2 真正的优势在于「开放许可证 + 密集架构 + Agentic RL」这个三重交集。 不是纯推理天花板。

三种思考模式:同一个模型,三种行为

Granite 4.2 最实用的设计是 Thinking 开关。每个 checkpoint 都支持三种模式,通过 chat template 切换:

模式 行为 最佳场景
Thinking 全量思维链推理 复杂编程、多步推理、高精度任务
Non-thinking 直接回答,不输出思维链 高吞吐对话、简单问答
Low-effort 短推理预算,快速回答简单问题 高频流量下的精度/延迟平衡

这跟在 OpenAI o-series 模型上控制 reasoning_effort 参数是同一个模式。区别在于:Granite 4.2 把这个开关放到了开放权重层级。 你的团队可以在自建端点上一模一样地控制推理算力开销,而不用把流量路由到第三方 API。

部署:从笔记本到 数据中心 全覆盖

Granite 4.2 在部署选择上没有设任何门槛:

  • 3B — 通过 Ollama 或 LM Studio 在笔记本上直接跑
  • 8B — 单张现代 GPU(RTX 4090 / A10 / L40S)即可运行
  • 30B — 企业级 FP8 或 FP4(NVFP4)通过 vLLM 部署,单卡 A100/H100 可行

IBM 还内置了一层 Speculative Decoding 来提升输出速度——在不改变模型行为的前提下,30B 的 per-token 输出速率显著快于同等规模的密集模型。

量化方面,官方提供了 FP8(无需校准)、FP4(NVFP4 格式)、以及 GGUF Q4_K_M 到 Q2_K 的全系列,覆盖从本地到生产级的各种部署场景。

函数调用的重大升级

对 Agent 开发者来说,一个关键细节是:Granite 4.2 原生支持 OpenAI 兼容的函数调用格式。通过 vLLM 的 --tool-call-parser granite 标志,任何 OpenAI-compatible client 可以直接连到端点,不需要额外胶水代码。

这意味着现有的 Agent 框架(Codex、OpenCode、Terminus-2、OpenHands 等)可以无缝切换到 Granite 4.2,只需要改一个 endpoint URL。

Granite Speech 5.0:470M 的边缘语音模型

和语言模型一同发布的还有两个语音模型。Granite Speech 5.0 Turbo CTC 只有 470M 参数,是 Granite 家族中最小的成员。它没有 LLM 骨干,专门做自动语音识别(ASR)。

IBM 的测试显示,它在 Hugging Face Open ASR 排行榜上的最佳竞品大约 6,000 RTFx,而 Granite Speech 5.0 Turbo CTC 在单张 H200 上跑到了 12,600 RTFx——两倍以上的吞吐量,意味着它能在 1 秒内转录 3 小时的语音录音。

这个重量级的模型适合笔记本电脑上的实时语音识别、语音应用开发、以及大规模呼叫中心转录分析。

写在最后:开放权重模型的「差异化战争」

如果你把 Granite 4.2 放到 2026 年 8 月的开放权重模型全景里看,它的定位就非常清楚了。

它不是在和 DeepSeek V4 比 Chat Arena 分数,也不是在跟 Qwen 3.6 拼多模态。它在回答一个更务实的问题:「如果你的企业想自己部署一个能在真实工作中干活的 Agent,哪个模型是最安全的起点?」

Apache 2.0 许可证 + 密集架构 + Agentic RL 训练 + 全套部署方案——IBM 在这四个维度上同时满足了企业客户的需求。没有许可证陷阱(不是 Qwen 的「仅限研究」协议),没有部署争议(不是 MoE 模型的显存黑盒),没有「你回家试试吧」的收件箱讨论。

对于工程团队来说,现在有一个新的选择:一台 H100 + 一个 vLLM endpoint + Granite 4.2 30B,你就可以拥有一个在 SWE-Bench 上拿 57% 的私有编码 Agent。这对于有数据合规要求的金融、医疗、政府和军工客户来说,可能是 2026 年最重要的开放模型发布之一。

而 8B 模型的存在,则让那些资源有限的团队同样可以享受 Agentic RL 的好处——这是 IBM 比很多「只会出一款巨无霸模型」的公司聪明的地方。

📌 延伸阅读:此前写过 《Model Router 大战爆发!Cursor、Ramp、Meta 一周内同时推出 AI 模型路由器》 — 模型路由器生态快速形成,Granite 4.2 作为新的开放权重选项,会在路由器世界里占据什么位置?值得持续观察。

By AI博士 万戈