<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Decision Model on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/decision-model/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Sat, 10 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/decision-model/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>微软也下场做决策模型了，Jev 同一周融资 8.7 亿美元：这个品类，正式进入「大厂时间」！</title>
        <link>https://www.yesmiracle.net/post/20261010-microsoft-decision-1-jev-decision-model-big-vendor/</link>
        <pubDate>Sat, 10 Oct 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20261010-microsoft-decision-1-jev-decision-model-big-vendor/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20261010-microsoft-decision-1-jev-decision-model-big-vendor/cover.svg" alt="Featured image of post 微软也下场做决策模型了，Jev 同一周融资 8.7 亿美元：这个品类，正式进入「大厂时间」！" /&gt;&lt;p&gt;如果你上个月问我「决策模型」是什么，我会说那是 Jev 一个人的品类。这周之后，我不敢这么讲了。&lt;/p&gt;
&lt;p&gt;两件事撞在一起。先是 10 月 9 日，微软发布了一个叫 &lt;strong&gt;Microsoft-Decision-1&lt;/strong&gt; 的模型，定位很直白——「fast decision-making」。紧接着，Jev 的东家 &lt;strong&gt;TypeSafe AI&lt;/strong&gt; 宣布融资 &lt;strong&gt;8.7 亿美元&lt;/strong&gt;，估值 &lt;strong&gt;75 亿美元&lt;/strong&gt;，a16z 领投，Martin Casado 进董事会，红杉、DCVC 跟投，官方稿里还补了一句「财富 500 强里有三分之一在『Jev on』」。&lt;/p&gt;
&lt;p&gt;半年前，你跟我聊决策模型，我大概率会先解释一遍它跟 LLM 的区别（我们之前也写过 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive/&#34; &gt;《TypeSafe AI Jev 深度解析》&lt;/a&gt;）。现在不用解释了——微软自己下场，等于替这个品类做了最好的背书。&lt;/p&gt;
&lt;p&gt;我想借这两件事，聊聊一个更别扭的话题：&lt;strong&gt;当大厂决定抄，一个品类的护城河到底还剩什么。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;微软这次发了什么&#34;&gt;微软这次发了什么&lt;/h2&gt;
&lt;p&gt;先把事实摆清楚。微软这篇发布稿的作者是 Office of the CTO 的 VP of Engineering，措辞很克制，但信息量不小。&lt;/p&gt;
&lt;p&gt;Microsoft-Decision-1 不是又一个聊天模型，它是一个&lt;strong&gt;决策打分&lt;/strong&gt;模型：给定一组固定选项，它给每个选项输出一个&lt;strong&gt;校准过的概率分数&lt;/strong&gt;。支持 yes/no、多选、打分，也支持对 AI 回答和 agent 动作做 rubric 评分——全部通过一次结构化的 API 调用。&lt;/p&gt;
&lt;p&gt;底座这件事最有意思：它是**在 Qwen3.5-9B 上做后训练（post-train）**得到的，做的是单遍（single-pass）决策打分，而且微软明说，后面会「rebase 到别的底座上，包括自家 MAI 和 OpenAI」。这句话你多读两遍——&lt;strong&gt;一个 9B 的开源模型，后训练一下，就成了微软的决策模型产品线。&lt;/strong&gt; 这是「大厂两周抄完」最赤裸的一次示范。&lt;/p&gt;
&lt;p&gt;性能上，微软给的是：在&lt;strong&gt;36 个 benchmark、约 15 万个问题&lt;/strong&gt;的对比里拿到最高准确率（题目对训练是盲的）；速度上，比第二名 H2O-Lightning-4B v1.1 快 &lt;strong&gt;2.5 倍&lt;/strong&gt;，比 GPT-6 Sol 快 &lt;strong&gt;35 倍&lt;/strong&gt;（P50 延迟）。它还专门讲了五件事：速度、泛化、鲁棒性、校准、安全。&lt;/p&gt;
&lt;p&gt;其中两个数字我觉得值得单独拎出来。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;鲁棒性&lt;/strong&gt;：微软把同一个请求做 8 种扰动（改写措辞、调换选项顺序、加格式噪声等），测决策翻盘的频率。结果是平均 &lt;strong&gt;1.3%&lt;/strong&gt; 翻盘，而在「选项描述改写」「选项顺序颠倒或打乱」这两种情况下是 &lt;strong&gt;0 翻盘&lt;/strong&gt;。这解决的是决策模型最要命的工程问题——同样的输入，别给出两个不同的决定。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;校准&lt;/strong&gt;：微软强调「概率本身是 API 的一部分，不只是排名分」，所以一个 90% 的预测，在代表性样本上应该大约对 9 次。这句话是整个发布稿里最关键的一句，后面我会说为什么。&lt;/p&gt;
&lt;p&gt;另外，发布稿末尾有一行&lt;strong&gt;编者注&lt;/strong&gt;：这篇文章后来更新过，&lt;strong&gt;补上了 Jev 在准确率和校准上的 benchmark&lt;/strong&gt;。也就是说，微软自证成绩的时候，对标对象里赫然写着 Jev。而它选来测「公开模型」的排行榜，是 &lt;strong&gt;JevBench&lt;/strong&gt;——Jev 自己的榜。&lt;/p&gt;
&lt;p&gt;这两个细节加起来，说明了一件事：&lt;strong&gt;这个品类的公共标尺，是 Jev 定的。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;jev-那边钱到了&#34;&gt;Jev 那边，钱到了&lt;/h2&gt;
&lt;p&gt;再看 TypeSafe。8.7 亿美元、75 亿估值，领投是 a16z。官方稿写得很有个性，基本是「我们融了一大笔钱，然后会把它变成给你们的好处」的调子。给开发者的承诺是「更多 machine-native 的模型」，给企业的承诺是补齐企业功能，给潜在员工的承诺是「我们是家真公司，稳」。&lt;/p&gt;
&lt;p&gt;真正有信息量的是一句：「财富 500 强里有三分之一在用 Jev」，以及「已经在生产环境帮客户省了数百万美元」。&lt;/p&gt;
&lt;p&gt;把两件事放在一起看，味道就出来了。&lt;/p&gt;
&lt;h2 id=&#34;同一周两个相反的信号&#34;&gt;同一周，两个相反的信号&lt;/h2&gt;
&lt;p&gt;我做了一张表，把这次直接对上的两方摆在一起。声明一下：微软那列来自它的发布稿，Jev 那列来自 TypeSafe 官方稿和它公开的定位，凡是官方没说的我都留空，不替他们填。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th&gt;Microsoft-Decision-1&lt;/th&gt;
          &lt;th&gt;Jev（TypeSafe）&lt;/th&gt;
          &lt;th&gt;通用 LLM 基线&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;底座&lt;/td&gt;
          &lt;td&gt;Qwen3.5-9B 后训练，将 rebase 到 MAI/OpenAI&lt;/td&gt;
          &lt;td&gt;自有 System One 模型&lt;/td&gt;
          &lt;td&gt;通用大模型（如 GPT-6 Sol）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;定位&lt;/td&gt;
          &lt;td&gt;路由 / 分类 / 优先排序 / 校验 / 工作流控制&lt;/td&gt;
          &lt;td&gt;结构化决策与打分&lt;/td&gt;
          &lt;td&gt;生成文本、推理&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;延迟&lt;/td&gt;
          &lt;td&gt;号称 P50 比 GPT-6 Sol 快约 35x&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
          &lt;td&gt;基线&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;校准&lt;/td&gt;
          &lt;td&gt;概率即 API，90% 应约等于 9/10 命中&lt;/td&gt;
          &lt;td&gt;被微软拿去对标校准&lt;/td&gt;
          &lt;td&gt;需额外工程&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;分发&lt;/td&gt;
          &lt;td&gt;Microsoft Foundry + OpenRouter + 自家 Copilot/XBOX&lt;/td&gt;
          &lt;td&gt;企业直销 / API&lt;/td&gt;
          &lt;td&gt;各家平台&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;成本信号&lt;/td&gt;
          &lt;td&gt;内部 XBOX 用例称比 GPT-6 Sol 便宜约 200x&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;时点&lt;/td&gt;
          &lt;td&gt;2026-10-09 发布&lt;/td&gt;
          &lt;td&gt;同周宣布 8.7 亿美元融资&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;看这张表，你会注意到一个不太好受的事实：&lt;strong&gt;左边那一列，几乎每一项都是「微软把某个东西做得更便宜、更快、更容易拿到」。&lt;/strong&gt; 而右边 Jev 那一列里，真正拿得出手、且别人短期抄不走的，只有两样——先发的模型积累，和那份被全行业拿来当标尺的 benchmark。&lt;/p&gt;
&lt;h2 id=&#34;我的判断&#34;&gt;我的判断&lt;/h2&gt;
&lt;p&gt;热闹的是融资数字，残酷的是分发逻辑。说几个我自己的看法。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第一，决策模型在「模型层」这件事上，已经被微软亲手证伪了。&lt;/strong&gt; 一个 9B 的开源底座后训练一下，就能在自家 36 个 benchmark 上拿第一、速度甩开一个量级——这意味着「训一个决策模型」本身不再是什么护城河。半年前这可能是 Jev 的独家手艺，现在门槛被微软拉到「拿 Qwen 微调一下」。所以 10 月 3 日我写过 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20261003-openai-decisions-api-jev-clone-wars/&#34; &gt;《14 天，OpenAI 就抄了个 Jev！》&lt;/a&gt;，那篇讲的是 API 层的复制；&lt;strong&gt;这周发生的是模型层 + 分发层的正面进攻&lt;/strong&gt;，比那次狠得多。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第二，那 Jev 的 75 亿估值买的是什么？买的是模型之外的东西。&lt;/strong&gt; 既然模型层能抄，钱就一定不是为模型付的。它买的是三样：一是 benchmark 的定义权——JevBench 成了这个品类的公共标尺，连微软自证都要贴着它测，这是「规则制定者」的位置；二是企业信任，「财富 500 强三分之一在用」这种数字，是几年才攒得出来的销售资产；三是那套 harness 和数据积累。&lt;strong&gt;在模型被商品化之后，价值会往两头跑——往下跑到数据和校准，往上跑到「谁能定义什么算对」。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第三，真正的战场其实是「校准」，不是「准确率」。&lt;/strong&gt; 微软这篇稿子最重的一段给了校准（90% 就该对九成）。为什么？因为决策模型一旦进了生产——路由、风控、审核、agent 的 guardrail——它输出的不是一个待审的文本，而是一个&lt;strong&gt;会被软件直接执行的动作&lt;/strong&gt;。这种场景下，一个「不准但自信」的分数比一个「不准且谦逊」的分数危险得多。所以微软专门补测了 Jev 的校准——这是在暗示：准确性大家都能卷，&lt;strong&gt;校准才是分别高下的地方&lt;/strong&gt;，而校准不是调调参数就有的，它需要真实场景的分布数据。这才是 Jev 那 75 亿里最硬的一块。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第四，商业化的残酷面是价格。&lt;/strong&gt; 互通的地方在于，微软把 Decision-1 直接摆进了 Microsoft Foundry 和 OpenRouter，还给了自家 Copilot、XBOX 用作背书（XBOX Research 那个用例号称比 GPT-6 Sol 便宜 200 倍）。也就是说，这个品类从诞生的第一周起，就被塞进了大厂的分发管道和价格战里。对做 routing、分类、内容审核、guardrail 的团队来说，这当然是好消息——多了一个便宜得多的选项；但对一个靠卖决策模型 API 为生的公司来说，&lt;strong&gt;大厂自带渠道 + 自带补贴&lt;/strong&gt;，是比任何技术竞争都难打的仗。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第五，也得给微软这份成绩打个折。&lt;/strong&gt; 「36 个 benchmark 拿第一」是&lt;strong&gt;自家&lt;/strong&gt;的 benchmark 组合，「比 GPT-6 Sol 快 35 倍」是&lt;strong&gt;自家&lt;/strong&gt;的测量，底座是 Qwen 后训练、且没公布训练细节和成本。这不是说它在吹——这类发布稿的自证属性是行业惯例——而是说，&lt;strong&gt;真正的检验在独立复现&lt;/strong&gt;。上一次大家被「发布即第一」的榜单教育过很多轮了，这次我建议同样保持一点怀疑：等第三方把它的校准曲线和自己的数据一测，再说它到底省不省事。&lt;/p&gt;
&lt;h2 id=&#34;那这周对做-agent-的人意味着什么&#34;&gt;那这周对做 Agent 的人意味着什么&lt;/h2&gt;
&lt;p&gt;不谈谁赢谁输，说点能照做的。&lt;/p&gt;
&lt;p&gt;如果你在做 agent 的路由、分类、内容审核、或者动作 guardrail，现在的选项结构变了：过去你得在「通用 LLM 硬扛（贵、慢、概率不可靠）」和「自己训/买决策模型（贵、要数据）」之间选，现在中间多了一条——一个便宜量级、速度甩开、概率带校准的现成打分接口。&lt;strong&gt;对这类「高频、低风险、要求结构化输出」的判断，决策模型本来就比 LLM 合适，现在它变得更便宜了，这条线只会往更多场景铺。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;但有三个坑要算清楚。一是&lt;strong&gt;迁移成本&lt;/strong&gt;——你的判断逻辑如果已经写死在某个 LLM 的 prompt 里，换到决策模型的 API 形态（固定选项 + 概率）是要重构的。二是&lt;strong&gt;校准的复现&lt;/strong&gt;——厂商宣传的校准是在它的样本上，你的分布不一样，落地前得自己重测一遍。三是&lt;strong&gt;锁定&lt;/strong&gt;——微软明说底座会 rebase 到 MAI/OpenAI，意味着&lt;strong&gt;同一个产品背后的模型会换&lt;/strong&gt;，你的决策分布也可能跟着漂，这件事得有监控。&lt;/p&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;
&lt;p&gt;决策模型这个品类，前半程是个技术故事——有人证明了「不用生成文本也能做决定，而且更快更准」。这周之后，它变成了一个分发故事——&lt;strong&gt;大厂把「训一个决策模型」拉低成「微调一个开源底座」，然后把成品塞进自己的渠道和价格里。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;所以 Jev 那 75 亿，成立与否不看它模型多强，看它能不能在「模型被商品化」之后，继续握住那两样抄不走的东西：&lt;strong&gt;定义 benchmark 的权力，和让企业相信「同一个问题永远返回同一个决定」的信任。&lt;/strong&gt; 前者它已经握住了（连微软都在用它的榜），后者才是接下来真正的仗。&lt;/p&gt;
&lt;p&gt;热闹的是融资数字。真正决定结局的，是当微软把 Decision-1 变成一个 Foundry 里的 SKU 之后，还有多少人愿意为一个「决策模型」单独付钱。&lt;/p&gt;
&lt;h2 id=&#34;相关阅读&#34;&gt;相关阅读&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive/&#34; &gt;《TypeSafe AI Jev 深度解析：放弃文本生成的「System One 模型」凭什么这么火？》&lt;/a&gt;——这篇讲的是 Jev 的技术底子，本篇讲的是它这周面对的大厂压力。&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20261003-openai-decisions-api-jev-clone-wars/&#34; &gt;《14 天，OpenAI 就抄了个 Jev！「克隆战争」开打，东家估值已谈 100 亿！》&lt;/a&gt;——API 层的第一轮复制；本篇是模型层与分发层的第二轮。&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260925-decision-model-llm-hybrid-architecture/&#34; &gt;《决策模型 + LLM 混合架构：Jev、OpenJev、AnyJev、Laya 四大 System One 方案横评与融合设计》&lt;/a&gt;——想知道决策模型和 LLM 怎么配合，看这篇的融合设计。&lt;/li&gt;
&lt;/ul&gt;
</description>
        </item>
        
    </channel>
</rss>
