如果你上个月问我「决策模型」是什么,我会说那是 Jev 一个人的品类。这周之后,我不敢这么讲了。
两件事撞在一起。先是 10 月 9 日,微软发布了一个叫 Microsoft-Decision-1 的模型,定位很直白——「fast decision-making」。紧接着,Jev 的东家 TypeSafe AI 宣布融资 8.7 亿美元,估值 75 亿美元,a16z 领投,Martin Casado 进董事会,红杉、DCVC 跟投,官方稿里还补了一句「财富 500 强里有三分之一在『Jev on』」。
半年前,你跟我聊决策模型,我大概率会先解释一遍它跟 LLM 的区别(我们之前也写过 《TypeSafe AI Jev 深度解析》)。现在不用解释了——微软自己下场,等于替这个品类做了最好的背书。
我想借这两件事,聊聊一个更别扭的话题:当大厂决定抄,一个品类的护城河到底还剩什么。
微软这次发了什么
先把事实摆清楚。微软这篇发布稿的作者是 Office of the CTO 的 VP of Engineering,措辞很克制,但信息量不小。
Microsoft-Decision-1 不是又一个聊天模型,它是一个决策打分模型:给定一组固定选项,它给每个选项输出一个校准过的概率分数。支持 yes/no、多选、打分,也支持对 AI 回答和 agent 动作做 rubric 评分——全部通过一次结构化的 API 调用。
底座这件事最有意思:它是**在 Qwen3.5-9B 上做后训练(post-train)**得到的,做的是单遍(single-pass)决策打分,而且微软明说,后面会「rebase 到别的底座上,包括自家 MAI 和 OpenAI」。这句话你多读两遍——一个 9B 的开源模型,后训练一下,就成了微软的决策模型产品线。 这是「大厂两周抄完」最赤裸的一次示范。
性能上,微软给的是:在36 个 benchmark、约 15 万个问题的对比里拿到最高准确率(题目对训练是盲的);速度上,比第二名 H2O-Lightning-4B v1.1 快 2.5 倍,比 GPT-6 Sol 快 35 倍(P50 延迟)。它还专门讲了五件事:速度、泛化、鲁棒性、校准、安全。
其中两个数字我觉得值得单独拎出来。
鲁棒性:微软把同一个请求做 8 种扰动(改写措辞、调换选项顺序、加格式噪声等),测决策翻盘的频率。结果是平均 1.3% 翻盘,而在「选项描述改写」「选项顺序颠倒或打乱」这两种情况下是 0 翻盘。这解决的是决策模型最要命的工程问题——同样的输入,别给出两个不同的决定。
校准:微软强调「概率本身是 API 的一部分,不只是排名分」,所以一个 90% 的预测,在代表性样本上应该大约对 9 次。这句话是整个发布稿里最关键的一句,后面我会说为什么。
另外,发布稿末尾有一行编者注:这篇文章后来更新过,补上了 Jev 在准确率和校准上的 benchmark。也就是说,微软自证成绩的时候,对标对象里赫然写着 Jev。而它选来测「公开模型」的排行榜,是 JevBench——Jev 自己的榜。
这两个细节加起来,说明了一件事:这个品类的公共标尺,是 Jev 定的。
Jev 那边,钱到了
再看 TypeSafe。8.7 亿美元、75 亿估值,领投是 a16z。官方稿写得很有个性,基本是「我们融了一大笔钱,然后会把它变成给你们的好处」的调子。给开发者的承诺是「更多 machine-native 的模型」,给企业的承诺是补齐企业功能,给潜在员工的承诺是「我们是家真公司,稳」。
真正有信息量的是一句:「财富 500 强里有三分之一在用 Jev」,以及「已经在生产环境帮客户省了数百万美元」。
把两件事放在一起看,味道就出来了。
同一周,两个相反的信号
我做了一张表,把这次直接对上的两方摆在一起。声明一下:微软那列来自它的发布稿,Jev 那列来自 TypeSafe 官方稿和它公开的定位,凡是官方没说的我都留空,不替他们填。
| 维度 | Microsoft-Decision-1 | Jev(TypeSafe) | 通用 LLM 基线 |
|---|---|---|---|
| 底座 | Qwen3.5-9B 后训练,将 rebase 到 MAI/OpenAI | 自有 System One 模型 | 通用大模型(如 GPT-6 Sol) |
| 定位 | 路由 / 分类 / 优先排序 / 校验 / 工作流控制 | 结构化决策与打分 | 生成文本、推理 |
| 延迟 | 号称 P50 比 GPT-6 Sol 快约 35x | — | 基线 |
| 校准 | 概率即 API,90% 应约等于 9/10 命中 | 被微软拿去对标校准 | 需额外工程 |
| 分发 | Microsoft Foundry + OpenRouter + 自家 Copilot/XBOX | 企业直销 / API | 各家平台 |
| 成本信号 | 内部 XBOX 用例称比 GPT-6 Sol 便宜约 200x | — | — |
| 时点 | 2026-10-09 发布 | 同周宣布 8.7 亿美元融资 | — |
看这张表,你会注意到一个不太好受的事实:左边那一列,几乎每一项都是「微软把某个东西做得更便宜、更快、更容易拿到」。 而右边 Jev 那一列里,真正拿得出手、且别人短期抄不走的,只有两样——先发的模型积累,和那份被全行业拿来当标尺的 benchmark。
我的判断
热闹的是融资数字,残酷的是分发逻辑。说几个我自己的看法。
第一,决策模型在「模型层」这件事上,已经被微软亲手证伪了。 一个 9B 的开源底座后训练一下,就能在自家 36 个 benchmark 上拿第一、速度甩开一个量级——这意味着「训一个决策模型」本身不再是什么护城河。半年前这可能是 Jev 的独家手艺,现在门槛被微软拉到「拿 Qwen 微调一下」。所以 10 月 3 日我写过 《14 天,OpenAI 就抄了个 Jev!》,那篇讲的是 API 层的复制;这周发生的是模型层 + 分发层的正面进攻,比那次狠得多。
第二,那 Jev 的 75 亿估值买的是什么?买的是模型之外的东西。 既然模型层能抄,钱就一定不是为模型付的。它买的是三样:一是 benchmark 的定义权——JevBench 成了这个品类的公共标尺,连微软自证都要贴着它测,这是「规则制定者」的位置;二是企业信任,「财富 500 强三分之一在用」这种数字,是几年才攒得出来的销售资产;三是那套 harness 和数据积累。在模型被商品化之后,价值会往两头跑——往下跑到数据和校准,往上跑到「谁能定义什么算对」。
第三,真正的战场其实是「校准」,不是「准确率」。 微软这篇稿子最重的一段给了校准(90% 就该对九成)。为什么?因为决策模型一旦进了生产——路由、风控、审核、agent 的 guardrail——它输出的不是一个待审的文本,而是一个会被软件直接执行的动作。这种场景下,一个「不准但自信」的分数比一个「不准且谦逊」的分数危险得多。所以微软专门补测了 Jev 的校准——这是在暗示:准确性大家都能卷,校准才是分别高下的地方,而校准不是调调参数就有的,它需要真实场景的分布数据。这才是 Jev 那 75 亿里最硬的一块。
第四,商业化的残酷面是价格。 互通的地方在于,微软把 Decision-1 直接摆进了 Microsoft Foundry 和 OpenRouter,还给了自家 Copilot、XBOX 用作背书(XBOX Research 那个用例号称比 GPT-6 Sol 便宜 200 倍)。也就是说,这个品类从诞生的第一周起,就被塞进了大厂的分发管道和价格战里。对做 routing、分类、内容审核、guardrail 的团队来说,这当然是好消息——多了一个便宜得多的选项;但对一个靠卖决策模型 API 为生的公司来说,大厂自带渠道 + 自带补贴,是比任何技术竞争都难打的仗。
第五,也得给微软这份成绩打个折。 「36 个 benchmark 拿第一」是自家的 benchmark 组合,「比 GPT-6 Sol 快 35 倍」是自家的测量,底座是 Qwen 后训练、且没公布训练细节和成本。这不是说它在吹——这类发布稿的自证属性是行业惯例——而是说,真正的检验在独立复现。上一次大家被「发布即第一」的榜单教育过很多轮了,这次我建议同样保持一点怀疑:等第三方把它的校准曲线和自己的数据一测,再说它到底省不省事。
那这周对做 Agent 的人意味着什么
不谈谁赢谁输,说点能照做的。
如果你在做 agent 的路由、分类、内容审核、或者动作 guardrail,现在的选项结构变了:过去你得在「通用 LLM 硬扛(贵、慢、概率不可靠)」和「自己训/买决策模型(贵、要数据)」之间选,现在中间多了一条——一个便宜量级、速度甩开、概率带校准的现成打分接口。对这类「高频、低风险、要求结构化输出」的判断,决策模型本来就比 LLM 合适,现在它变得更便宜了,这条线只会往更多场景铺。
但有三个坑要算清楚。一是迁移成本——你的判断逻辑如果已经写死在某个 LLM 的 prompt 里,换到决策模型的 API 形态(固定选项 + 概率)是要重构的。二是校准的复现——厂商宣传的校准是在它的样本上,你的分布不一样,落地前得自己重测一遍。三是锁定——微软明说底座会 rebase 到 MAI/OpenAI,意味着同一个产品背后的模型会换,你的决策分布也可能跟着漂,这件事得有监控。
写在最后
决策模型这个品类,前半程是个技术故事——有人证明了「不用生成文本也能做决定,而且更快更准」。这周之后,它变成了一个分发故事——大厂把「训一个决策模型」拉低成「微调一个开源底座」,然后把成品塞进自己的渠道和价格里。
所以 Jev 那 75 亿,成立与否不看它模型多强,看它能不能在「模型被商品化」之后,继续握住那两样抄不走的东西:定义 benchmark 的权力,和让企业相信「同一个问题永远返回同一个决定」的信任。 前者它已经握住了(连微软都在用它的榜),后者才是接下来真正的仗。
热闹的是融资数字。真正决定结局的,是当微软把 Decision-1 变成一个 Foundry 里的 SKU 之后,还有多少人愿意为一个「决策模型」单独付钱。
相关阅读
- 《TypeSafe AI Jev 深度解析:放弃文本生成的「System One 模型」凭什么这么火?》——这篇讲的是 Jev 的技术底子,本篇讲的是它这周面对的大厂压力。
- 《14 天,OpenAI 就抄了个 Jev!「克隆战争」开打,东家估值已谈 100 亿!》——API 层的第一轮复制;本篇是模型层与分发层的第二轮。
- 《决策模型 + LLM 混合架构:Jev、OpenJev、AnyJev、Laya 四大 System One 方案横评与融合设计》——想知道决策模型和 LLM 怎么配合,看这篇的融合设计。