<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Granite on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/granite/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Thu, 27 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/granite/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>IBM 开源 Granite 4.2！Apache 2.0 原生推理模型，30B 跑 SWE-Bench 57%，Agent 能力全下放！</title>
        <link>https://www.yesmiracle.net/post/20260827-ibm-granite-42-open-reasoning/</link>
        <pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260827-ibm-granite-42-open-reasoning/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260827-ibm-granite-42-open-reasoning/cover.svg" alt="Featured image of post IBM 开源 Granite 4.2！Apache 2.0 原生推理模型，30B 跑 SWE-Bench 57%，Agent 能力全下放！" /&gt;&lt;p&gt;你有没有注意到，2026 年下半年的开放权重模型战场变了？&lt;/p&gt;
&lt;p&gt;前两年大家比的是「聊天好不好用」、「能不能写诗写代码」。但到了今天，OpenAI、Anthropic、Google 的闭源模型在纯聊天质量上已经把门槛推到了肉眼看不见的高度，开放权重模型再追同一件事已经没有意义。&lt;/p&gt;
&lt;p&gt;所以新的战场出现了：&lt;strong&gt;可靠的工具调用、软件工程能力、以及经得起真实工作负载考验的推理能力。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;昨天（8 月 25 日），IBM 在 Hugging Face 上静悄悄地发布了 &lt;strong&gt;Granite 4.2&lt;/strong&gt;——一个专门面向 Agent 工作负载的开放权重模型家族。它不追聊天质量，不打 MoE 规模战，而是带着一套全新的训练管线，在 &lt;strong&gt;Apache 2.0&lt;/strong&gt; 许可证下给了社区三颗阻挡不住的子弹：3B、8B、30B。&lt;/p&gt;
&lt;p&gt;而最让人兴奋的，不是它有多大，而是&lt;strong&gt;它把「推理」和「Agent」能力做成了原生功能，而不是靠额外 Prompt 钩上去的。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;granite-42三个尺寸一个设计哲学&#34;&gt;Granite 4.2：三个尺寸，一个设计哲学&lt;/h2&gt;
&lt;p&gt;先来看看全家福：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;型号&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;参数&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;层数&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;隐藏层维度&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;MLP 维度&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Agentic RL&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;许可证&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Granite 4.2 3B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;3B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;40&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;2560&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;8192&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;❌&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;Apache 2.0&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Granite 4.2 8B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;8B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;40&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;4096&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;12800&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;✅&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;Apache 2.0&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Granite 4.2 30B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;30B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;64&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;4096&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;32768&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;✅&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;Apache 2.0&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;三个模型都是纯密集（Dense）Transformer 架构，没有使用 MoE。这是 IBM 的一个明确选择：密集架构的推理行为更可预测，部署边界更清晰，不像 MoE 模型那样「显存没算对就炸了」。&lt;/p&gt;
&lt;p&gt;所有模型支持 &lt;strong&gt;131,072 tokens&lt;/strong&gt; 上下文窗口（预训练阶段扩展到 512K，实际部署时以 served context 为准）。相比 Granite 4.1，4.2 最大的变化不是参数规模，而是训练管线——从「指令跟随」全面转向「推理原生」。&lt;/p&gt;
&lt;h2 id=&#34;agentic-rl-管线在真实沙箱里学干活&#34;&gt;Agentic RL 管线：在真实沙箱里「学干活」&lt;/h2&gt;
&lt;p&gt;这是 Granite 4.2 最有意思的部分。8B 和 30B 的训练不再止步于 SFT + RLHF，而是进入了一个&lt;strong&gt;多阶段、多环境的强化学习管道&lt;/strong&gt;：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;SFT&lt;/strong&gt; — 约 720 万样本，100B tokens 的监督微调&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Foundational RL (RLVR)&lt;/strong&gt; — 数学、科学、编程、推理、工具调用全覆盖&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Skill Boosters&lt;/strong&gt; — 指令跟随增强、代码能力增强&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;SWE Stage 1&lt;/strong&gt; — 128K 上下文，单轮软件工程 rollout&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;SWE Stage 2&lt;/strong&gt; — 128K 上下文，&lt;strong&gt;多轮&lt;/strong&gt;沙箱 rollout（最多 128 个环境交互轮次）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Terminal RL&lt;/strong&gt; — 64K 上下文，终端操作（最多 64 轮）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Search RL&lt;/strong&gt; — 128K 上下文，Web 搜索与信息检索（最多 64 轮）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;RLHF&lt;/strong&gt; — 最终偏好对齐&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;每一阶段都是独立的异步 GRPO 训练，从前一阶段 checkpoint 热启动。训练数据来自 OpenHands、OpenCode、Terminus-2、SWE-agent、OpenResearcher、&lt;strong&gt;甚至 Hermes&lt;/strong&gt; 等 Agent 框架的沙箱轨迹。&lt;/p&gt;
&lt;p&gt;值得注意的是：&lt;strong&gt;3B 模型没有经过 Agentic RL 阶段。&lt;/strong&gt; 这不是疏忽，而是设计选择——IBM 认为 3B 的容量不足以从多轮工具调用轨迹中学习，同样的算力投到 8B 和 30B 上回报更高。这解释了为什么 3B 在 Agent 评测上完全没有分数。&lt;/p&gt;
&lt;h2 id=&#34;benchmark-数据密集模型的正面硬刚&#34;&gt;Benchmark 数据：密集模型的正面硬刚&lt;/h2&gt;
&lt;p&gt;IBM 公布的评测数据是最直观的定位工具：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;评测基准&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;3B&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;8B&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;30B&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;SWE-Bench Verified&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;47.67&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;57.00&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;Terminal-Bench 2.1&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;20.56&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;29.24&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;tau3-bench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;50.99&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;66.34&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;68.05&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;BFCL v4 (函数调用)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;52.41&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;50.29&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;61.39&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;AIME25 (数学推理)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;78.33&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;86.67&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;89.17&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;GPQA (研究生科学)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;54.80&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;64.14&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;66.41&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;MMLU-Pro&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;67.84&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;74.04&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;77.60&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;RULER 128K (长上下文)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;55.30&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;71.41&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;81.38&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;三个关键洞察：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第一，SWE-Bench Verified 57.00&lt;/strong&gt; 是 30B 开放权重模型里极具竞争力的水平。它在真实 GitHub issue 上评测——不是代码补全，是修 bug、加功能、改测试。对比同等规模的竞品，这个成绩意味着你可以在单台 A100/H100 上部署一个能真正干活的编码 Agent。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第二，8B 和 30B 之间的 Agent 差距，远小于 3B 和 8B 之间的悬崖。&lt;/strong&gt; 8B 的 SWE-Bench 47.67 已经足够做实际的编码 Agent 工作，而 3B 直接没有分数。如果你的团队需要 Agent 能力、只有单卡预算，8B 是最小的选择。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第三，在纯推理能力上，30B 不是最高的。&lt;/strong&gt; DeepSeek V4、Qwen 3.6、GLM 5.2 在 100B+ 参数规模下都有更高的 AIME25/MMLU-Pro 分数。&lt;strong&gt;Granite 4.2 真正的优势在于「开放许可证 + 密集架构 + Agentic RL」这个三重交集。&lt;/strong&gt; 不是纯推理天花板。&lt;/p&gt;
&lt;h2 id=&#34;三种思考模式同一个模型三种行为&#34;&gt;三种思考模式：同一个模型，三种行为&lt;/h2&gt;
&lt;p&gt;Granite 4.2 最实用的设计是 &lt;strong&gt;Thinking 开关&lt;/strong&gt;。每个 checkpoint 都支持三种模式，通过 chat template 切换：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;模式&lt;/th&gt;
          &lt;th&gt;行为&lt;/th&gt;
          &lt;th&gt;最佳场景&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;Thinking&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;全量思维链推理&lt;/td&gt;
          &lt;td&gt;复杂编程、多步推理、高精度任务&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;Non-thinking&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;直接回答，不输出思维链&lt;/td&gt;
          &lt;td&gt;高吞吐对话、简单问答&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;Low-effort&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;短推理预算，快速回答简单问题&lt;/td&gt;
          &lt;td&gt;高频流量下的精度/延迟平衡&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这跟在 OpenAI o-series 模型上控制 reasoning_effort 参数是同一个模式。区别在于：&lt;strong&gt;Granite 4.2 把这个开关放到了开放权重层级。&lt;/strong&gt; 你的团队可以在自建端点上一模一样地控制推理算力开销，而不用把流量路由到第三方 API。&lt;/p&gt;
&lt;h2 id=&#34;部署从笔记本到-数据中心-全覆盖&#34;&gt;部署：从笔记本到 数据中心 全覆盖&lt;/h2&gt;
&lt;p&gt;Granite 4.2 在部署选择上没有设任何门槛：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;3B&lt;/strong&gt; — 通过 Ollama 或 LM Studio 在笔记本上直接跑&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;8B&lt;/strong&gt; — 单张现代 GPU（RTX 4090 / A10 / L40S）即可运行&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;30B&lt;/strong&gt; — 企业级 FP8 或 FP4（NVFP4）通过 vLLM 部署，单卡 A100/H100 可行&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;IBM 还内置了一层 &lt;strong&gt;Speculative Decoding&lt;/strong&gt; 来提升输出速度——在不改变模型行为的前提下，30B 的 per-token 输出速率显著快于同等规模的密集模型。&lt;/p&gt;
&lt;p&gt;量化方面，官方提供了 FP8（无需校准）、FP4（NVFP4 格式）、以及 GGUF Q4_K_M 到 Q2_K 的全系列，覆盖从本地到生产级的各种部署场景。&lt;/p&gt;
&lt;h2 id=&#34;函数调用的重大升级&#34;&gt;函数调用的重大升级&lt;/h2&gt;
&lt;p&gt;对 Agent 开发者来说，一个关键细节是：Granite 4.2 原生支持 &lt;strong&gt;OpenAI 兼容的函数调用格式&lt;/strong&gt;。通过 vLLM 的 &lt;code&gt;--tool-call-parser granite&lt;/code&gt; 标志，任何 OpenAI-compatible client 可以直接连到端点，&lt;strong&gt;不需要额外胶水代码。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这意味着现有的 Agent 框架（Codex、OpenCode、Terminus-2、OpenHands 等）可以无缝切换到 Granite 4.2，只需要改一个 endpoint URL。&lt;/p&gt;
&lt;h2 id=&#34;granite-speech-50470m-的边缘语音模型&#34;&gt;Granite Speech 5.0：470M 的边缘语音模型&lt;/h2&gt;
&lt;p&gt;和语言模型一同发布的还有两个语音模型。Granite Speech 5.0 Turbo CTC 只有 &lt;strong&gt;470M 参数&lt;/strong&gt;，是 Granite 家族中最小的成员。它没有 LLM 骨干，专门做自动语音识别（ASR）。&lt;/p&gt;
&lt;p&gt;IBM 的测试显示，它在 Hugging Face Open ASR 排行榜上的最佳竞品大约 &lt;strong&gt;6,000 RTFx&lt;/strong&gt;，而 Granite Speech 5.0 Turbo CTC &lt;strong&gt;在单张 H200 上跑到了 12,600 RTFx&lt;/strong&gt;——两倍以上的吞吐量，意味着它能在 1 秒内转录 3 小时的语音录音。&lt;/p&gt;
&lt;p&gt;这个重量级的模型适合笔记本电脑上的实时语音识别、语音应用开发、以及大规模呼叫中心转录分析。&lt;/p&gt;
&lt;h2 id=&#34;写在最后开放权重模型的差异化战争&#34;&gt;写在最后：开放权重模型的「差异化战争」&lt;/h2&gt;
&lt;p&gt;如果你把 Granite 4.2 放到 2026 年 8 月的开放权重模型全景里看，它的定位就非常清楚了。&lt;/p&gt;
&lt;p&gt;它不是在和 DeepSeek V4 比 Chat Arena 分数，也不是在跟 Qwen 3.6 拼多模态。它在回答一个更务实的问题：&lt;strong&gt;「如果你的企业想自己部署一个能在真实工作中干活的 Agent，哪个模型是最安全的起点？」&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Apache 2.0 许可证 + 密集架构 + Agentic RL 训练 + 全套部署方案——IBM 在这四个维度上同时满足了企业客户的需求。没有许可证陷阱（不是 Qwen 的「仅限研究」协议），没有部署争议（不是 MoE 模型的显存黑盒），没有「你回家试试吧」的收件箱讨论。&lt;/p&gt;
&lt;p&gt;对于工程团队来说，现在有一个新的选择：一台 H100 + 一个 vLLM endpoint + Granite 4.2 30B，你就可以拥有一个在 SWE-Bench 上拿 57% 的私有编码 Agent。这对于有数据合规要求的金融、医疗、政府和军工客户来说，可能是 2026 年最重要的开放模型发布之一。&lt;/p&gt;
&lt;p&gt;而 8B 模型的存在，则让那些资源有限的团队同样可以享受 Agentic RL 的好处——这是 IBM 比很多「只会出一款巨无霸模型」的公司聪明的地方。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;📌 &lt;strong&gt;延伸阅读&lt;/strong&gt;：此前写过 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260821-model-router-war-cursor-ramp-meta/&#34; &gt;《Model Router 大战爆发！Cursor、Ramp、Meta 一周内同时推出 AI 模型路由器》&lt;/a&gt; — 模型路由器生态快速形成，Granite 4.2 作为新的开放权重选项，会在路由器世界里占据什么位置？值得持续观察。&lt;/p&gt;&lt;/blockquote&gt;
</description>
        </item>
        
    </channel>
</rss>
