Featured image of post 微软也下场做决策模型了,Jev 同一周融资 8.7 亿美元:这个品类,正式进入「大厂时间」!

微软也下场做决策模型了,Jev 同一周融资 8.7 亿美元:这个品类,正式进入「大厂时间」!

如果你上个月问我「决策模型」是什么,我会说那是 Jev 一个人的品类。这周之后,我不敢这么讲了。

两件事撞在一起。先是 10 月 9 日,微软发布了一个叫 Microsoft-Decision-1 的模型,定位很直白——「fast decision-making」。紧接着,Jev 的东家 TypeSafe AI 宣布融资 8.7 亿美元,估值 75 亿美元,a16z 领投,Martin Casado 进董事会,红杉、DCVC 跟投,官方稿里还补了一句「财富 500 强里有三分之一在『Jev on』」。

半年前,你跟我聊决策模型,我大概率会先解释一遍它跟 LLM 的区别(我们之前也写过 《TypeSafe AI Jev 深度解析》)。现在不用解释了——微软自己下场,等于替这个品类做了最好的背书。

我想借这两件事,聊聊一个更别扭的话题:当大厂决定抄,一个品类的护城河到底还剩什么。

微软这次发了什么

先把事实摆清楚。微软这篇发布稿的作者是 Office of the CTO 的 VP of Engineering,措辞很克制,但信息量不小。

Microsoft-Decision-1 不是又一个聊天模型,它是一个决策打分模型:给定一组固定选项,它给每个选项输出一个校准过的概率分数。支持 yes/no、多选、打分,也支持对 AI 回答和 agent 动作做 rubric 评分——全部通过一次结构化的 API 调用。

底座这件事最有意思:它是**在 Qwen3.5-9B 上做后训练(post-train)**得到的,做的是单遍(single-pass)决策打分,而且微软明说,后面会「rebase 到别的底座上,包括自家 MAI 和 OpenAI」。这句话你多读两遍——一个 9B 的开源模型,后训练一下,就成了微软的决策模型产品线。 这是「大厂两周抄完」最赤裸的一次示范。

性能上,微软给的是:在36 个 benchmark、约 15 万个问题的对比里拿到最高准确率(题目对训练是盲的);速度上,比第二名 H2O-Lightning-4B v1.1 快 2.5 倍,比 GPT-6 Sol 快 35 倍(P50 延迟)。它还专门讲了五件事:速度、泛化、鲁棒性、校准、安全。

其中两个数字我觉得值得单独拎出来。

鲁棒性:微软把同一个请求做 8 种扰动(改写措辞、调换选项顺序、加格式噪声等),测决策翻盘的频率。结果是平均 1.3% 翻盘,而在「选项描述改写」「选项顺序颠倒或打乱」这两种情况下是 0 翻盘。这解决的是决策模型最要命的工程问题——同样的输入,别给出两个不同的决定。

校准:微软强调「概率本身是 API 的一部分,不只是排名分」,所以一个 90% 的预测,在代表性样本上应该大约对 9 次。这句话是整个发布稿里最关键的一句,后面我会说为什么。

另外,发布稿末尾有一行编者注:这篇文章后来更新过,补上了 Jev 在准确率和校准上的 benchmark。也就是说,微软自证成绩的时候,对标对象里赫然写着 Jev。而它选来测「公开模型」的排行榜,是 JevBench——Jev 自己的榜。

这两个细节加起来,说明了一件事:这个品类的公共标尺,是 Jev 定的。

Jev 那边,钱到了

再看 TypeSafe。8.7 亿美元、75 亿估值,领投是 a16z。官方稿写得很有个性,基本是「我们融了一大笔钱,然后会把它变成给你们的好处」的调子。给开发者的承诺是「更多 machine-native 的模型」,给企业的承诺是补齐企业功能,给潜在员工的承诺是「我们是家真公司,稳」。

真正有信息量的是一句:「财富 500 强里有三分之一在用 Jev」,以及「已经在生产环境帮客户省了数百万美元」。

把两件事放在一起看,味道就出来了。

同一周,两个相反的信号

我做了一张表,把这次直接对上的两方摆在一起。声明一下:微软那列来自它的发布稿,Jev 那列来自 TypeSafe 官方稿和它公开的定位,凡是官方没说的我都留空,不替他们填。

维度 Microsoft-Decision-1 Jev(TypeSafe) 通用 LLM 基线
底座 Qwen3.5-9B 后训练,将 rebase 到 MAI/OpenAI 自有 System One 模型 通用大模型(如 GPT-6 Sol)
定位 路由 / 分类 / 优先排序 / 校验 / 工作流控制 结构化决策与打分 生成文本、推理
延迟 号称 P50 比 GPT-6 Sol 快约 35x — 基线
校准 概率即 API,90% 应约等于 9/10 命中 被微软拿去对标校准 需额外工程
分发 Microsoft Foundry + OpenRouter + 自家 Copilot/XBOX 企业直销 / API 各家平台
成本信号 内部 XBOX 用例称比 GPT-6 Sol 便宜约 200x — —
时点 2026-10-09 发布 同周宣布 8.7 亿美元融资 —

看这张表,你会注意到一个不太好受的事实:左边那一列,几乎每一项都是「微软把某个东西做得更便宜、更快、更容易拿到」。 而右边 Jev 那一列里,真正拿得出手、且别人短期抄不走的,只有两样——先发的模型积累,和那份被全行业拿来当标尺的 benchmark。

我的判断

热闹的是融资数字,残酷的是分发逻辑。说几个我自己的看法。

第一,决策模型在「模型层」这件事上,已经被微软亲手证伪了。 一个 9B 的开源底座后训练一下,就能在自家 36 个 benchmark 上拿第一、速度甩开一个量级——这意味着「训一个决策模型」本身不再是什么护城河。半年前这可能是 Jev 的独家手艺,现在门槛被微软拉到「拿 Qwen 微调一下」。所以 10 月 3 日我写过 《14 天,OpenAI 就抄了个 Jev!》,那篇讲的是 API 层的复制;这周发生的是模型层 + 分发层的正面进攻,比那次狠得多。

第二,那 Jev 的 75 亿估值买的是什么?买的是模型之外的东西。 既然模型层能抄,钱就一定不是为模型付的。它买的是三样:一是 benchmark 的定义权——JevBench 成了这个品类的公共标尺,连微软自证都要贴着它测,这是「规则制定者」的位置;二是企业信任,「财富 500 强三分之一在用」这种数字,是几年才攒得出来的销售资产;三是那套 harness 和数据积累。在模型被商品化之后,价值会往两头跑——往下跑到数据和校准,往上跑到「谁能定义什么算对」。

第三,真正的战场其实是「校准」,不是「准确率」。 微软这篇稿子最重的一段给了校准(90% 就该对九成)。为什么?因为决策模型一旦进了生产——路由、风控、审核、agent 的 guardrail——它输出的不是一个待审的文本,而是一个会被软件直接执行的动作。这种场景下,一个「不准但自信」的分数比一个「不准且谦逊」的分数危险得多。所以微软专门补测了 Jev 的校准——这是在暗示:准确性大家都能卷,校准才是分别高下的地方,而校准不是调调参数就有的,它需要真实场景的分布数据。这才是 Jev 那 75 亿里最硬的一块。

第四,商业化的残酷面是价格。 互通的地方在于,微软把 Decision-1 直接摆进了 Microsoft Foundry 和 OpenRouter,还给了自家 Copilot、XBOX 用作背书(XBOX Research 那个用例号称比 GPT-6 Sol 便宜 200 倍)。也就是说,这个品类从诞生的第一周起,就被塞进了大厂的分发管道和价格战里。对做 routing、分类、内容审核、guardrail 的团队来说,这当然是好消息——多了一个便宜得多的选项;但对一个靠卖决策模型 API 为生的公司来说,大厂自带渠道 + 自带补贴,是比任何技术竞争都难打的仗。

第五,也得给微软这份成绩打个折。 「36 个 benchmark 拿第一」是自家的 benchmark 组合,「比 GPT-6 Sol 快 35 倍」是自家的测量,底座是 Qwen 后训练、且没公布训练细节和成本。这不是说它在吹——这类发布稿的自证属性是行业惯例——而是说,真正的检验在独立复现。上一次大家被「发布即第一」的榜单教育过很多轮了,这次我建议同样保持一点怀疑:等第三方把它的校准曲线和自己的数据一测,再说它到底省不省事。

那这周对做 Agent 的人意味着什么

不谈谁赢谁输,说点能照做的。

如果你在做 agent 的路由、分类、内容审核、或者动作 guardrail,现在的选项结构变了:过去你得在「通用 LLM 硬扛(贵、慢、概率不可靠)」和「自己训/买决策模型(贵、要数据)」之间选,现在中间多了一条——一个便宜量级、速度甩开、概率带校准的现成打分接口。对这类「高频、低风险、要求结构化输出」的判断,决策模型本来就比 LLM 合适,现在它变得更便宜了,这条线只会往更多场景铺。

但有三个坑要算清楚。一是迁移成本——你的判断逻辑如果已经写死在某个 LLM 的 prompt 里,换到决策模型的 API 形态(固定选项 + 概率)是要重构的。二是校准的复现——厂商宣传的校准是在它的样本上,你的分布不一样,落地前得自己重测一遍。三是锁定——微软明说底座会 rebase 到 MAI/OpenAI,意味着同一个产品背后的模型会换,你的决策分布也可能跟着漂,这件事得有监控。

写在最后

决策模型这个品类,前半程是个技术故事——有人证明了「不用生成文本也能做决定,而且更快更准」。这周之后,它变成了一个分发故事——大厂把「训一个决策模型」拉低成「微调一个开源底座」,然后把成品塞进自己的渠道和价格里。

所以 Jev 那 75 亿,成立与否不看它模型多强,看它能不能在「模型被商品化」之后,继续握住那两样抄不走的东西:定义 benchmark 的权力,和让企业相信「同一个问题永远返回同一个决定」的信任。 前者它已经握住了(连微软都在用它的榜),后者才是接下来真正的仗。

热闹的是融资数字。真正决定结局的,是当微软把 Decision-1 变成一个 Foundry 里的 SKU 之后,还有多少人愿意为一个「决策模型」单独付钱。

相关阅读

By AI博士 万戈