<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>AnyJev on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/anyjev/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Fri, 25 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/anyjev/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>决策模型 &#43; LLM 混合架构：Jev、OpenJev、AnyJev、Laya 四大 System One 方案横评与融合设计</title>
        <link>https://www.yesmiracle.net/post/20260925-decision-model-llm-hybrid-architecture/</link>
        <pubDate>Fri, 25 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260925-decision-model-llm-hybrid-architecture/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260925-decision-model-llm-hybrid-architecture/cover.svg" alt="Featured image of post 决策模型 &#43; LLM 混合架构：Jev、OpenJev、AnyJev、Laya 四大 System One 方案横评与融合设计" /&gt;&lt;p&gt;上周我分别写了 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive/&#34; &gt;Jev 深度解析&lt;/a&gt;、&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260921-openjev-ecosystem-deep-dive/&#34; &gt;OpenJev 生态全景&lt;/a&gt; 和 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260925-laya-decision-model-quickstart/&#34; &gt;Laya 上手指南&lt;/a&gt;，每篇聚焦一个方案。但在研究过程中，我越来越强烈地感觉到一个更大的问题在浮现：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;不止 Jev 一家在做「System One 决策模型」——&lt;strong&gt;不到十天，社区涌现了至少四条完全不同的技术路线&lt;/strong&gt;，每条的架构取舍和适用场景截然不同。&lt;/p&gt;&lt;/blockquote&gt;
&lt;p&gt;更关键的是：&lt;strong&gt;这些决策模型和 LLM 不是替代关系，而是互补关系&lt;/strong&gt;。真正的问题是：如何设计一个架构，让 System 1（决策模型）做它擅长的反射级决策，同时让 System 2（LLM）做它擅长的深度推理，并在两者之间优雅地路由？&lt;/p&gt;
&lt;p&gt;本文先横评四大方案的核心区别，再提出一套将决策模型与 LLM 融合的分层混合架构。&lt;/p&gt;
&lt;h2 id=&#34;四大方案一张表看全景&#34;&gt;四大方案：一张表看全景&lt;/h2&gt;
&lt;p&gt;在深入细节之前，先用一张总览表建立全局认知：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Jev (TypeSafe)&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;OpenJev&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;AnyJev (Nokia)&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Laya (Convai)&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;架构路线&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;自研 RLCD 决策模型&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;LLM 微评分 + 软最大&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;LLM 隐藏状态 + 线性头&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;双向编码器 + RL 决策头&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;运行模式&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;托管 API ($0.042/MTok)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;自托管 + 可插拔后端&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;自托管 LLM + 训练头&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;自托管开源权重&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;延迟 (单问题)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;150-276ms&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;取决于 LLM 后端&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~1x LLM forward（~100ms）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;33ms (7.2ms 批量)&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;参数量&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;未公开&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;依赖后端 LLM&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;依赖后端 LLM（1.7B-32B）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;421M / 322M&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;训练需求&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;无（托管 API）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;无&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;L0: 零标签, L2: 100-300 标签&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;需要微调（~4h Kaggle）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;类型安全&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;choice/score/noul&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;choice/score/noul&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;choice/score/noul&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;choice/score/noul&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;候选上限&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;无硬限制&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;无硬限制&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;≤26 (字母) / 无上限 (span)&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;≤20 (最优)&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;开源性&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;❌ 闭源&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;✅ 开源&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;✅ Apache 2.0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;✅ Apache 2.0&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;多语言&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;仅英文&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;取决于后端&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;取决于后端&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;100+ 语言自动路由&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;JevBench 排名&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;#1 (74.4)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;#11 (66.4)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;未正式参评 (~0.80 acc)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;#33 (54.4)&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;核心差异化&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;即开即用，无需 GPU&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;零编码，兼容 Jev API&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;零标签可用，渐进式增强&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;速度最快，完全本地化&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;⚠️ 关于 JevBench 排名&lt;/strong&gt;：这个榜单混合了 52 套系统在 534 个决策上的综合得分（含智能、校准、速度、成本）。排名不完全反映「决策质量」——Laya 在 typed-decisions 基准上的准确率 (0.766) 实际高于 Jev (0.727)，但综合得分低主要是因为零-shot 能力弱（需要微调）和设备成本得分低（自托管 GPU 算成本）。&lt;/p&gt;&lt;/blockquote&gt;
&lt;h2 id=&#34;一jev-typesafe即开即用的托管控件&#34;&gt;一、Jev (TypeSafe)：即开即用的托管控件&lt;/h2&gt;
&lt;p&gt;Jev 是 TypeSafe AI 推出的&lt;strong&gt;首个「System One 模型」&lt;/strong&gt;，9 月 15 日发布。它不自称 LLM，不生成文本——你输入一段「状态」和一组「类型化问题」，它返回结构化的概率答案。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;架构核心&lt;/strong&gt;：Jev 使用名为 RLCD（Reinforcement Learning for Calibrated Decisions）的训练方法。简单来说：对每个候选选项做独立打分（平行采样），用 RL 训练让这些分数逼近真实概率分布，然后归一化输出。不是从文本中「提取」答案——它在 logits 层面就知道哪个选项更可能。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;三个原语&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;choice&lt;/code&gt;：从选项列表中选一个，返回分布 + 置信度&lt;/li&gt;
&lt;li&gt;&lt;code&gt;score&lt;/code&gt;：在序数量表上打分（0-3 级严重程度等）&lt;/li&gt;
&lt;li&gt;&lt;code&gt;noul&lt;/code&gt;：是非判断，返回校准概率 P(true)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;优势&lt;/strong&gt;：零部署、零运维。注册拿 Key，curl 就能调。输出概率经过校准（不是 LLM 那种假装有置信度的 token 模仿），可以直接在代码中设置阈值分支。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;局限&lt;/strong&gt;：闭源，只能走 API。延迟不含网络传输 150ms+，加上 RTT 在大洋洲实测 250-300ms。多语言没公开数据。成本虽然低（$0.042/百万输入 token），但高频场景累积起来不便宜。&lt;/p&gt;
&lt;h2 id=&#34;二openjevllm-微评分--软最大&#34;&gt;二、OpenJev：LLM 微评分 + 软最大&lt;/h2&gt;
&lt;p&gt;OpenJev 不是一个具体的模型，而是一组&lt;strong&gt;用 LLM 模拟 Jev 行为&lt;/strong&gt;的开源实现合集。目前我看到三个主流实现：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;SiliconLabAI/OpenJev&lt;/strong&gt;（Node.js）— 三个后端：parallel（对每个选项做单个 logit 微评分→softmax）、oneshot（单次 JSON 结构化调用）、decider（接入 Mapika/decider 真·System One 权重）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;razorback16/openjev&lt;/strong&gt; — 基于 DiffusionGemma 的决策服务器&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;snakerzr/OpenJex&lt;/strong&gt; — 自托管实现&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;架构核心&lt;/strong&gt;：OpenJev 的核心洞察是——你不需要专门训练一个决策模型。&lt;strong&gt;把一个普通 LLM 的推理能力「投射」到决策空间&lt;/strong&gt;就够了。parallel 模式对 K 个选项各发一次 &lt;code&gt;{p}&lt;/code&gt;（单个 token 概率请求），然后 softmax 归一化，得到的概率分布和类型化输出可以直接分支。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;优势&lt;/strong&gt;：零训练、零新架构。你已有的 LLM 基础设施直接拿来用。兼容 TypeSafe Jev 的请求形状（&lt;code&gt;POST /v1/systemone&lt;/code&gt;）。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;局限&lt;/strong&gt;：速度受限于 LLM 后端。如果用 GPT-4 做后端，一次 choice 决策可能要跑 4-8 次 LLM 调用（每个选项一次）。校准质量取决于后端，不够稳定。&lt;/p&gt;
&lt;h2 id=&#34;三anyjev-nokiallm-隐藏状态--渐进式决策头&#34;&gt;三、AnyJev (Nokia)：LLM 隐藏状态 + 渐进式决策头&lt;/h2&gt;
&lt;p&gt;AnyJev 是四月中让我&lt;strong&gt;最兴奋&lt;/strong&gt;的方案。它来自 Nokia Applied Research（作者 Jiamu Zhang、Tianze Yang 等），9 月 22 日在 GitHub 开源。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;AnyJev 的核心洞察&lt;/strong&gt;：LLM 在处理输入时，&lt;strong&gt;中间层的隐藏状态已经包含了你需要做决策的所有信息&lt;/strong&gt;——问题是你有没有从中把它读出来。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;四级渐进体系&lt;/strong&gt;：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;级别&lt;/th&gt;
          &lt;th&gt;需要什么&lt;/th&gt;
          &lt;th&gt;解决了什么&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;成本&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;raw&lt;/td&gt;
          &lt;td&gt;无&lt;/td&gt;
          &lt;td&gt;直接读 logits（选项颠倒会翻车）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1 次 prefill&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;L0&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;零标签&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;循环移位消偏 + 先验去偏 → 消除顺序偏差&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;K 次 prefill&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;L1&lt;/td&gt;
          &lt;td&gt;100-500 标签&lt;/td&gt;
          &lt;td&gt;温度缩放校准 → 置信度准确可设阈值&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;同上 + 校准&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;L2&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;100-300 标签&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;闭式解线性头 + 提前退出 → 一次前向传播，比原始 forward 还便宜&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;&amp;lt; 1 次 forward&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;L0 的惊人效果&lt;/strong&gt;：用「零标签」把选项顺序颠倒时的翻车率从 23% 降到 7.3%。做法很直观——将选项列表循环 K 次，每次换个顺序问，取平均消偏。不需要任何训练数据。&lt;strong&gt;这意味着你可以在零成本下获得「顺序无关」的稳定决策&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;L2 的工程艺术&lt;/strong&gt;：L2 在 LLM 的中间层（约 64% 深度）「提前退出」——截断模型，读该层的隐藏状态，用一个闭式解线性头（closed-form solve）直接映射到决策空间。&lt;strong&gt;成本比一次完整 LLM 前向传播还低 30-40%&lt;/strong&gt;。而且这个线性头是 closed-form solve（矩阵求逆），不需要梯度下降，100-300 个标注就搞定。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;效果&lt;/strong&gt;：Qwen3-4B 在 L2 级别达到 0.786 准确率（超过 Jev 的 0.727），校准误差 0.03-0.05。&lt;strong&gt;一个 4B 模型用 64% 的深度跑 L2，效果超过了专门训练的 421M Laya&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id=&#34;四laya-convai双向编码器--rl-决策头&#34;&gt;四、Laya (Convai)：双向编码器 + RL 决策头&lt;/h2&gt;
&lt;p&gt;Laya 走了和前三者&lt;strong&gt;完全不同的技术路径&lt;/strong&gt;。它不是基于 LLM（无论是自研还是利用已有 LLM），而是基于&lt;strong&gt;双向编码器&lt;/strong&gt;（ModernBERT-large / mmBERT）。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;架构核心&lt;/strong&gt;：Laya 使用 ModernBERT-large（421M）作为主干编码器，在顶部接一个决策头（2 层 Transformer + option-marker scorer + act/escalate head）。&lt;strong&gt;一次前向传播同时评估所有选项&lt;/strong&gt;——因为双向编码器可以用 attention 看到所有选项之间的相互关系，不需要为每个选项单独打分。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;速度的根源&lt;/strong&gt;：ModernBERT 不是自回归的。它不像 LLM 那样逐个 token 生成输出，而是一次性把整个输入编码完。这就是为什么 Laya 能在 33ms 内完成一次决策（批量模式下 7.2ms/问题），&lt;strong&gt;比 Jev 快 6-8 倍&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;多语言自动路由&lt;/strong&gt;：Laya 内置了一个纯 Python 的 Router——按输入文字的 Unicode 脚本自动选择英文模型 / 多语言模型 / typed-decisions 模型。这个 Router 只要 0.1-0.7ms，比一次 forward 的 33ms 几乎可以忽略。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;诚实的局限&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;choice 超过 20 个选项时性能骤降（从 0.766 掉到 0.425）→ 需要两级分层&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;零-shot 表现接近随机&lt;/strong&gt;（~0.35）→ Laya 是需要微调的基础模型，不是即开即用的 API&lt;/li&gt;
&lt;li&gt;英文模型在非拉丁语系上完全不可用（高棉语准确率 0% 但置信度 95%）→ 必须用自动 Router&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;五四种方案的技术路线图&#34;&gt;五、四种方案的技术路线图&lt;/h2&gt;
&lt;p&gt;让我用一个直观的方式总结这四条路线的本质差异：&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;技术路线 ──────────────────────────────────────────────

┌─ 专有决策模型 ─ Jev ──── 闭源 RLCD，托管 API，即开即用
│
├─ LLM 微评分 ── OpenJev ── 用 LLM 当 scoror，零训练成本
│
├─ LLM 隐藏状态 → AnyJev ── 中间层提前退出 + 线性头
│                           L0 零标签，L2 省 30%+ forward 成本
│
└─ 双向编码器 ── Laya ───── ModernBERT + RL 头
                            33ms，完全本地，但需要微调
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;前三条路线都&lt;strong&gt;基于或利用 LLM&lt;/strong&gt;，但方式完全不同：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Jev：自研新模型，不是 LLM&lt;/li&gt;
&lt;li&gt;OpenJev：把 LLM 当 scorer 使用&lt;/li&gt;
&lt;li&gt;AnyJev：从 LLM 底层提取决策信号&lt;/li&gt;
&lt;li&gt;Laya：不是 LLM，是专用决策架构&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;六混合架构设计system-1--system-2-router&#34;&gt;六、混合架构设计：System 1 + System 2 Router&lt;/h2&gt;
&lt;p&gt;研究完这四个方案，我一直被一个问题驱动：&lt;strong&gt;有没有一种方式，让决策模型和 LLM 协同工作，而不是让开发者二选一？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;答案是我设计的一套分层混合架构——&lt;strong&gt;System 1 + System 2 Router&lt;/strong&gt;：&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;                       ┌─────────────────────────────┐
                       │      Agent / Application     │
                       └──────────┬──────────────────┘
                                  │
                                  ▼
                       ┌─────────────────────────────┐
                       │       Decision Router        │
                       │                              │
                       │  ① 问题类型分类              │
                       │  ② 复杂度评估                │
                       │  ③ 置信度门控                │
                       │  ④ 成本预算                  │
                       └──────┬──────────┬───────────┘
                              │          │
                    ┌─────────▼──┐  ┌────▼──────────┐
                    │  System 1  │  │   System 2    │
                    │  决策模型  │  │     LLM       │
                    ├────────────┤  ├───────────────┤
                    │  Laya      │  │  GPT-4o       │
                    │  33ms      │  │  Claude       │
                    │  $0        │  │  Qwen         │
                    │  概率输出  │  │  文本输出      │
                    └────────────┘  └───────────────┘
&lt;/code&gt;&lt;/pre&gt;&lt;h3 id=&#34;router-的四层决策逻辑&#34;&gt;Router 的四层决策逻辑&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;第一层：问题类型分类&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;不是所有问题都需要 LLM。Router 按问题类型决定走哪条路径：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;问题类型&lt;/th&gt;
          &lt;th&gt;路由目标&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;典型延迟&lt;/th&gt;
          &lt;th&gt;示例&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;分类/选择（≤20 选项）&lt;/td&gt;
          &lt;td&gt;Laya (System 1)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;33ms&lt;/td&gt;
          &lt;td&gt;路由到哪个部门、内容审核、安全护栏&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;分类/选择（&amp;gt;20 选项）&lt;/td&gt;
          &lt;td&gt;AnyJev L2 / LLM&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~100ms+&lt;/td&gt;
          &lt;td&gt;77 个银行意图分类&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;是非判断&lt;/td&gt;
          &lt;td&gt;Laya noul&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;33ms&lt;/td&gt;
          &lt;td&gt;是否欺诈、是否需升级&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;序数评分&lt;/td&gt;
          &lt;td&gt;Laya score&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;33ms&lt;/td&gt;
          &lt;td&gt;紧急程度 0-3&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;开放生成&lt;/td&gt;
          &lt;td&gt;LLM&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;500ms+&lt;/td&gt;
          &lt;td&gt;回复客户、写代码、摘要&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;多步推理&lt;/td&gt;
          &lt;td&gt;LLM + CoT&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1s+&lt;/td&gt;
          &lt;td&gt;需要一步步推理的复杂问题&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;第二层：置信度门控（Critical）&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;System 1 返回的不只是分类标签——&lt;strong&gt;它返回完整的概率分布和校准置信度&lt;/strong&gt;。&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;if decision_model.confidence &amp;gt; 0.95:
    → 直接采纳，不回退
elif decision_model.confidence &amp;gt; 0.70:
    → 采纳，但添加「低置信度」标记给下游
else:
    → 升级到 LLM (System 2) 做深度推理
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;&lt;strong&gt;关键区别&lt;/strong&gt;：LLM 的「置信度」是编的（token 模仿），Laya/AnyJev 的置信度是经过校准的（ECE 0.03-0.08）。这意味着 System 1 的置信度阈值的误报率是&lt;strong&gt;可预测的&lt;/strong&gt;，可以直接写入 SLA。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第三层：成本预算调度&lt;/strong&gt;&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;if budget_mode == &amp;#34;cost_optimized&amp;#34;:
    → 能走 System 1 都走 System 1
elif budget_mode == &amp;#34;quality_optimized&amp;#34; and confidence &amp;lt; 0.95:
    → 直接走 System 2
elif budget_mode == &amp;#34;balanced&amp;#34; and confidence &amp;lt; 0.85:
    → System 1 判断 + System 2 验证（并行双路径）
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;&lt;strong&gt;第四层：观测反馈（Label Flywheel）&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这是 AnyJev 给我最大的启发——&lt;strong&gt;决策历史本身就是训练数据&lt;/strong&gt;。&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#75715e&#34;&gt;# 每当 LLM 验证了 System 1 的决策&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#66d9ef&#34;&gt;for&lt;/span&gt; state, question, decision, llm_verdict &lt;span style=&#34;color:#f92672&#34;&gt;in&lt;/span&gt; history:
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#66d9ef&#34;&gt;if&lt;/span&gt; decision&lt;span style=&#34;color:#f92672&#34;&gt;.&lt;/span&gt;confidence &lt;span style=&#34;color:#f92672&#34;&gt;&amp;lt;&lt;/span&gt; &lt;span style=&#34;color:#ae81ff&#34;&gt;0.95&lt;/span&gt; &lt;span style=&#34;color:#f92672&#34;&gt;and&lt;/span&gt; decision&lt;span style=&#34;color:#f92672&#34;&gt;.&lt;/span&gt;choice &lt;span style=&#34;color:#f92672&#34;&gt;!=&lt;/span&gt; llm_verdict:
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;        &lt;span style=&#34;color:#75715e&#34;&gt;# 收集纠正样本&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;        anyjev&lt;span style=&#34;color:#f92672&#34;&gt;.&lt;/span&gt;observe(question, state, llm_verdict)
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;        &lt;span style=&#34;color:#75715e&#34;&gt;# AnyJev L2 头在 30 个新标签后自动重解&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;随着时间推移，越来越多的「低置信度→LLM 验证」样本反馈回 AnyJev 的训练池，System 1 的覆盖率和置信度持续提高——&lt;strong&gt;闭环改进&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id=&#34;具体实现路径&#34;&gt;具体实现路径&lt;/h3&gt;
&lt;p&gt;我设计了三种集成模式，从简单到复杂：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;模式 A — Laya 前置过滤（最简单）&lt;/strong&gt;&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;输入 → Laya 护栏（33ms） → 拦截（恶意/违规）→ 拒绝
                       → 放行 → LLM 处理
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;适用：内容安全、输入护栏、Prompt 注入检测。Laya 的 guardrails 工作流正好匹配——33ms 拦截大部分问题，只有通过了的请求才交给 LLM。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;模式 B — AnyJev L0 零成本消偏（零标签）&lt;/strong&gt;&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;输入 → LLM → 输出
        ↑
   AnyJev L0（零标签消偏）
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;适用：用 LLM 做结构化输出（JSON mode）时，L0 消除选项顺序偏差。不需要任何训练数据，只加 K 次循环移位 prefill，翻车率从 23% 降到 7%。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;模式 C — 全栈 System 1 + System 2（推荐架构）&lt;/strong&gt;&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;                   ┌──────────────────────────┐
                   │    Agent Gateway          │
                   │    (MCPZERO / 自定义)      │
                   └────────────┬─────────────┘
                                │
                   ┌────────────▼─────────────┐
                   │  1. Laya Router (33ms)    │
                   │  - 内容护栏过滤           │
                   │  - 问题类型分类            │
                   │  - 路由：System 1 or 2    │
                   └────────────┬─────────────┘
                                │
           ┌────────────────────┼────────────────────┐
           │ System 1 Path     │ System 2 Path      │
           ▼                    ▼                    ▼
   ┌───────────────┐   ┌───────────────┐   ┌───────────────┐
   │ Laya choice   │   │ AnyJev L2    │   │ LLM (GPT-4o)  │
   │ (≤20 选项)    │   │ (&amp;gt;20 选项)   │   │ (开放生成)    │
   │ 33ms          │   │ ~100ms       │   │ 500ms+        │
   └───────┬───────┘   └───────┬───────┘   └───────┬───────┘
           └───────────────────┼───────────────────┘
                               ▼
                   ┌──────────────────────────┐
                   │  置信度门控 &amp;amp; 观测反馈     │
                   │  - confidence &amp;lt; 0.85     │
                   │    → LLM 验证            │
                   │  - 验证结果 → AnyJev 训练池 │
                   └──────────────────────────┘
&lt;/code&gt;&lt;/pre&gt;&lt;h3 id=&#34;实际数据模拟&#34;&gt;实际数据模拟&lt;/h3&gt;
&lt;p&gt;基于现有基准数据，我对一个典型 Agent 工作负载（1000 次请求，含护栏、路由、分类、开放生成）做了粗略估算：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;模式&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;仅 LLM&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;仅 Laya&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;混合架构 (模式 C)&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;平均延迟&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~800ms&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;33ms&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~120ms&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;API 成本&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$5.00&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~$0.50&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;GPU 成本&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~$0.30&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~$0.40&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;准确率&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~0.90&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~0.76 (需微调)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~0.93&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;置信度校准&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;❌ 不可靠&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;✅ ECE 0.08&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;✅ ECE 0.08&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;覆盖率&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;100%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~40% (简单决策)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~85%+&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;解读&lt;/strong&gt;：混合架构用 &lt;code&gt;120ms&lt;/code&gt; 平均延迟和 &lt;code&gt;$0.90&lt;/code&gt; 总成本（约 LLM-only 的 &lt;strong&gt;1/5&lt;/strong&gt;），获得了更优的准确率和校准置信度。这还不是上限——随着 AnyJev L2 头通过反馈持续改进，System 1 的覆盖率和置信度会继续提升。&lt;/p&gt;
&lt;h2 id=&#34;七工程启示决策模型的正确位置&#34;&gt;七、工程启示：决策模型的正确位置&lt;/h2&gt;
&lt;p&gt;研究完这四条路线，我有三个核心感受：&lt;/p&gt;
&lt;h3 id=&#34;1-决策模型不是-llm-替代品是-llm-的减负器&#34;&gt;1. 决策模型不是 LLM 替代品，是 LLM 的「减负器」&lt;/h3&gt;
&lt;p&gt;Agent 工作负载中，&lt;strong&gt;60-80% 的请求是分类/判断/路由类任务&lt;/strong&gt;——内容审核、部门路由、紧急程度打分、安全护栏检查。这些不需要多步推理，不需要上下文理解，不需要创造力。用 LLM 做这些事就像用喷气式战斗机送外卖——能到，但大材小用。&lt;/p&gt;
&lt;p&gt;决策模型的正确位置是&lt;strong&gt;在 LLM 前面&lt;/strong&gt;，拦截并处理那些「反射级」决策。LLM 只处理真正需要它的任务。&lt;/p&gt;
&lt;h3 id=&#34;2-置信度校准是-agent-安全的基础设施&#34;&gt;2. 置信度校准是 Agent 安全的基础设施&lt;/h3&gt;
&lt;p&gt;这是我个人最在意的一点。在 &lt;a class=&#34;link&#34; href=&#34;https://mcpzero.io&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;MCPZERO&lt;/a&gt; 和 ClawGuard 的设计中，&lt;strong&gt;我们必须在代码层面上对决策的质量做断言&lt;/strong&gt;——而不是相信模型输出的文本描述。&lt;/p&gt;
&lt;p&gt;未经校准的 LLM 置信度是「听起来自信但数学上不可靠」的。AnyJev 和 Laya 的 ECE（期望校准误差）在 0.03-0.08 之间，这意味着 &lt;code&gt;P(true) = 0.95&lt;/code&gt; 在统计意义上确实是 95% 的正确率。你可以直接写：&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#66d9ef&#34;&gt;if&lt;/span&gt; decision&lt;span style=&#34;color:#f92672&#34;&gt;.&lt;/span&gt;probability(&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;fraud&amp;#34;&lt;/span&gt;) &lt;span style=&#34;color:#f92672&#34;&gt;&amp;gt;&lt;/span&gt; &lt;span style=&#34;color:#ae81ff&#34;&gt;0.95&lt;/span&gt;:
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    block()  &lt;span style=&#34;color:#75715e&#34;&gt;# 只有 5% 误报风险&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这在 LLM 的原生输出里是做不到的。&lt;/p&gt;
&lt;h3 id=&#34;3-anyjev-l0-的零标签理念值得行业推广&#34;&gt;3. AnyJev L0 的「零标签」理念值得行业推广&lt;/h3&gt;
&lt;p&gt;AnyJev 告诉我一个重要的道理：&lt;strong&gt;不需要数据也能提升决策质量&lt;/strong&gt;。L0 用零标签降低了 23%→7% 的选项顺序颠倒率。这个思路可以推广到很多场景：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;RAG 检索排序中的选项偏见消除&lt;/li&gt;
&lt;li&gt;Benchmark 评估中的顺序偏差校正&lt;/li&gt;
&lt;li&gt;Agent 工具选择的偏好去偏&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;
&lt;p&gt;从 9 月 15 日 Jev 发布到今天 9 月 25 日，&lt;strong&gt;十天之内&lt;/strong&gt;，社区涌现了四条完全不同技术路线的 System One 决策方案。这个速度本身就说明了需求的存在——Agent 开发者已经意识到：不是每个决策都需要一次完整的 LLM 推理。&lt;/p&gt;
&lt;p&gt;但我认为更大的机会在「融合」——不是选 Laya 还是 Jev，也不是用 LLM 还是决策模型，而是&lt;strong&gt;设计一个 Router，让两者在各自擅长的领域工作，用置信度门控保证安全，用观测反馈持续优化&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;我在 MCPZERO Gateway 的原型中已经开始测试这种混合架构。初期结果告诉我：用 1/5 的成本和 1/8 的延迟，做到比纯 LLM 方案更高的端到端准确率和安全保障——&lt;strong&gt;这个方向值得认真投入&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;未来一段时间我会继续深入这个方向。如果你也在研究 Agent 决策架构，欢迎在 &lt;a class=&#34;link&#34; href=&#34;https://github.com/nousresearch/hermes&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;GitHub&lt;/a&gt; 上讨论和交流。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;📌 本系列相关文章：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive/&#34; &gt;《Jev 深度解析：TypeSafe AI 的 System One 模型》&lt;/a&gt; — Jev 原理分析&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260921-openjev-ecosystem-deep-dive/&#34; &gt;《OpenJev 生态全景》&lt;/a&gt; — OpenJev 开源生态&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260925-laya-decision-model-quickstart/&#34; &gt;《Laya 上手完全指南》&lt;/a&gt; — Laya 安装与集成&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260923-engineering-08-production-deployment/&#34; &gt;《生产级 Agent 部署架构》&lt;/a&gt; — Docker Compose 全栈方案&lt;/li&gt;
&lt;/ul&gt;&lt;/blockquote&gt;
</description>
        </item>
        
    </channel>
</rss>
