<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Jev on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/jev/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Mon, 21 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/jev/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>OpenJev 生态全景解析：当社区用 151M 参数在浏览器里复刻 Jev 的「System One」范式</title>
        <link>https://www.yesmiracle.net/post/20260921-openjev-ecosystem-deep-dive/</link>
        <pubDate>Mon, 21 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260921-openjev-ecosystem-deep-dive/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260921-openjev-ecosystem-deep-dive/cover.svg" alt="Featured image of post OpenJev 生态全景解析：当社区用 151M 参数在浏览器里复刻 Jev 的「System One」范式" /&gt;&lt;p&gt;如果你看了上一篇 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive&#34; &gt;Jev 的深度解析&lt;/a&gt;，应该已经理解了 TypeSafe AI 为什么放弃文本生成——并行采样、RLCD 训练、数学保证的类型安全——这些让 Jev 在结构化决策任务上比 LLM 快 200 倍、便宜 400 倍。&lt;/p&gt;
&lt;p&gt;然后有趣的事情发生了。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Jev 发布不到一周，开源社区里至少涌现出 8 个独立项目，试图用不同的技术路线复刻 Jev 的「System One」范式。&lt;/strong&gt; 有人用 ModernBERT + GLiClass 搭了个 151M 参数的纯编码器决策引擎，在公开 Benchmark 上宣称超越了 Jev 本身。有人往浏览器里灌了个 Qwen3-0.6B，让任何人免费在本地 GPU 上对比直接 Logit 读取和逐 token 生成的差距。还有人用 Google 的 DiffusionGemma 做并行决策，单步推理达成 90.8% 的 Jev 一致率。&lt;/p&gt;
&lt;p&gt;这不是开源社区在「山寨」一个 API。这是在用不同的技术栈验证同一个洞见：&lt;strong&gt;「AI 不需要会说话，会判断就够了。」&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这篇文章系统地梳理 OpenJev 生态——从技术路线、性能数据到工程启示。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-全景图八个项目三条技术路线&#34;&gt;1. 全景图：八个项目，三条技术路线&lt;/h2&gt;
&lt;p&gt;OpenJev 不是一个项目，而是一个&lt;strong&gt;快速扩散的生态系统&lt;/strong&gt;。我按底层技术路线把它们分为三类：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;分类&lt;/th&gt;
          &lt;th&gt;项目&lt;/th&gt;
          &lt;th&gt;核心模型&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;参数&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;路线&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;编码器路线&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;OpenJev Verdict 1.4&lt;/td&gt;
          &lt;td&gt;ModernBERT-base + GLiClass&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;151M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;双向编码器 + 分类头&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;/td&gt;
          &lt;td&gt;openJev-verdict-2.0&lt;/td&gt;
          &lt;td&gt;ModernBERT-base + 双通道&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;149.6M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;编码器 + 双校准通道&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;/td&gt;
          &lt;td&gt;Laya（参考）&lt;/td&gt;
          &lt;td&gt;ModernBERT-large&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;421M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;更大的编码器基线&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;扩散路线&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;JoshuaSP/open-jev&lt;/td&gt;
          &lt;td&gt;DiffusionGemma 26B-A4B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;扩散去噪 + Logit 约束&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;/td&gt;
          &lt;td&gt;razorback16/openjev&lt;/td&gt;
          &lt;td&gt;DiffusionGemma 26B-A4B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;同上的决策服务封装&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;LLM 路线&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;SemIf (workszop/openjev)&lt;/td&gt;
          &lt;td&gt;Qwen3-0.6B (GGUF)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.6B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;Browser WebGPU + Logit 读取&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;/td&gt;
          &lt;td&gt;zhihz/openjev&lt;/td&gt;
          &lt;td&gt;Qwen3-4B-Instruct&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;4B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;本地 MLX 推理&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;/td&gt;
          &lt;td&gt;TheoLeeCJ/openjev&lt;/td&gt;
          &lt;td&gt;多种开放模型&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;可变&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;LLM 分类头读取&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;商业&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;openjev.sh&lt;/td&gt;
          &lt;td&gt;N/A&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;N/A&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;付费代理 + $JEV 代币&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;三条路线的哲学完全不同。下面逐一拆解。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-编码器路线openjev-verdict151m-的纯判断引擎&#34;&gt;2. 编码器路线：OpenJev Verdict——151M 的纯判断引擎&lt;/h2&gt;
&lt;h3 id=&#34;架构&#34;&gt;架构&lt;/h3&gt;
&lt;p&gt;Verdict 是当前最「认真」的 OpenJev 项目。它不是把 LLM 拿来改 Prompt，而是&lt;strong&gt;从零用编码器搭了一个纯判断模型&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;核心组件：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;ModernBERT-base&lt;/strong&gt;（149.6M 参数）：Answer.AI 和 LightOn 联合研发的高效编码器，支持 8192 token 上下文，原生 unpadding，训练效率比旧版 BERT 高 4 倍&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLiClass 分类头&lt;/strong&gt;：bi-encoder 架构，将文档和候选标签联合编码后计算相似度&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;RLCD 风格训练&lt;/strong&gt;：用 Brier Score 等校准指标做优化信号&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;推理过程是&lt;strong&gt;非自回归&lt;/strong&gt;的：输入文档 + 候选标签列表 → ModernBERT 单次前向传播 → 分类头计算所有候选的 Logit → Softmax 归一化 → 直接输出概率分布。整个过程 &lt;strong&gt;20–35 毫秒&lt;/strong&gt;完成。&lt;/p&gt;
&lt;h3 id=&#34;verdict-14-的修复故事&#34;&gt;Verdict 1.4 的修复故事&lt;/h3&gt;
&lt;p&gt;V1.0 有几个低级但关键的工程缺陷：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Calibrator 没加载&lt;/strong&gt;：推理引擎在独立运行时忘了加载 &lt;code&gt;calibrator.json&lt;/code&gt;，实际上在用未校准的 temperature 1.0 瞎蒙&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;候选标签格式不匹配&lt;/strong&gt;：GLiClass 基座来自自然语言推理（NLI），期望标签写成假设句（&amp;ldquo;It is {description}&amp;quot;），但引擎直接送裸名词短语&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;上下文窗口过大&lt;/strong&gt;：训练数据的上下文平均 71 tokens，推理时却允许 1024，导致分布外漂移&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;V1.4 修复后，Standard 难度准确率从 62.5% → 69.4%（+6.9%），Hard 难度校准误差从 0.298 → 0.118（-60.4%）。这是一个很好的案例：&lt;strong&gt;即使架构对了，粗心的推理工程也能毁掉一切&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id=&#34;verdict-20151m-击败-421m&#34;&gt;Verdict 2.0：151M 击败 421M&lt;/h3&gt;
&lt;p&gt;Verdict 2.0 在 &lt;code&gt;LocalLLaMA/typed-decisions&lt;/code&gt; 这个企业级决策 Benchmark（2000 条金融/安全/客服/Agent Trace 数据）上交出了令人侧目的成绩：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;模型&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;参数量&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Top-1 准确率&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Brier Loss&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;ECE&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;延迟&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;Verdict 2.0&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;149.6M&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;77.10%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;0.0636&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1.44%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~20-25ms&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Laya&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;421.3M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;76.60%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.0660&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~31ms&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;TypeSafe Jev 1.13&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~150M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;72.70%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.1480&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;14.4%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~140ms&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;TF-IDF + LR&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;66.10%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.1520&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;2.07%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~8ms&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Verdict 1.0 基线&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;149.6M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26.10%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.5851&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;42.09%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~35ms&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;几个值得注意的点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Verdict 2.0 的准确率（77.10%）&lt;strong&gt;超过了 Jev 本身（72.70%）&lt;/strong&gt;。但要注意：Benchmark 数据集是 &lt;code&gt;LocalLLaMA/typed-decisions&lt;/code&gt;，不是 Jev 的 workflow evals。TypeSafe 明确拒绝在公开 Benchmark 上评测，所以这不是 apples-to-apples 对比。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;TF-IDF + Logistic Regression 拿到 66.10%&lt;/strong&gt;，说明这个数据集里相当一部分决策可以通过简单词频特征解决。Verdict 2.0 多出的 11% 来自需要深层语义判断的边界样本。&lt;/li&gt;
&lt;li&gt;Verdict 2.0 的双通道校准（Correctness Head + Distribution Channel）把 ECE 降到了 1.44%，这是&lt;strong&gt;数学上比 Jev 更好的校准度&lt;/strong&gt;。Jev 的文档里承认 ECE 约 14.4%。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;但是&lt;/strong&gt;：Verdict 2.0 目前只支持最多 25 个候选选项（24 + 1 弃权槽），而 Jev 支持 255。Verdict 的上下文窗口也受限于 ModernBERT 的 8192 token 位置编码。&lt;/p&gt;
&lt;h3 id=&#34;编码器路线的根本局限&#34;&gt;编码器路线的根本局限&lt;/h3&gt;
&lt;p&gt;编码器方案的优势是&lt;strong&gt;快且便宜&lt;/strong&gt;——一次前向传播决定所有事情。但它的上限也很清楚：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;没有推理能力：遇到需要多步推导的决策（「如果 A 且 B 则 C」），编码器要依赖训练数据中的模式覆盖&lt;/li&gt;
&lt;li&gt;不支持开放式输出：只能从预定义的候选中选择，不能动态生成新选项&lt;/li&gt;
&lt;li&gt;语言能力受限：相比在数十亿 token 上训练的 LLM，编码器的语言理解有限&lt;/li&gt;
&lt;li&gt;候选数量上限：25 vs Jev 的 255，差距明显&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;但&lt;strong&gt;如果结构化决策是它唯一的任务&lt;/strong&gt;，这些局限可能根本不成问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-扩散路线diffusiongemma-做并行决策&#34;&gt;3. 扩散路线：DiffusionGemma 做并行决策&lt;/h2&gt;
&lt;p&gt;JoshuaSP/open-jev 走了一条完全不同的路：用 Google 的 &lt;strong&gt;DiffusionGemma 26B-A4B&lt;/strong&gt;（一种非自回归扩散语言模型）来做并行决策。&lt;/p&gt;
&lt;h3 id=&#34;为什么用扩散模型&#34;&gt;为什么用扩散模型？&lt;/h3&gt;
&lt;p&gt;DiffusionGemma 不是逐 token 生成文本，而是从一个随机噪声向量开始，通过多步去噪直接「涌现」出完整输出。这意味着它能在&lt;strong&gt;单步去噪后就读取 Logit 做出决策&lt;/strong&gt;，而不需要走完整个扩散序列。&lt;/p&gt;
&lt;p&gt;对比 Jev 的并行采样与 DiffusionGemma 的扩散采样：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;&lt;/th&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;Jev&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;DiffusionGemma (1-step)&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;采样策略&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;专用并行架构&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;扩散去噪 + Logit 约束&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;单次决策速度&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;70-500ms&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~150ms（含 H100 推理）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;一致性&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;数学保证（原始 Jev）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;90.8%（复刻 337 题）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;类型安全&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;架构保证&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;约束解码保证&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;模型来源&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;私有训练&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;开放权重 26B&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id=&#34;实测结果&#34;&gt;实测结果&lt;/h3&gt;
&lt;p&gt;项目作者在 20 个 Jev 公开用例的 337 个问题上做了对比：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;Workflow&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;原始 1-step&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;分组 1-step&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;分组 2-step&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;原始 Jev&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Agent 跟踪&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;78.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;78.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;80.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;78.8%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;客服&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;91.3%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;82.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;84.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;89.1%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;发票处理&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;92.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;92.2%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;94.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;97.0%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;安全事件&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;69.2%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;73.1%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;73.1%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;80.8%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;全部&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;88.4%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;86.1%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;87.8%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;90.8%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;分组 2-step 推理比原始方法快 &lt;strong&gt;4.85 倍&lt;/strong&gt;、便宜 &lt;strong&gt;79%&lt;/strong&gt;，正确判断只少了 2 个（337 题中从 298 → 296）。&lt;/p&gt;
&lt;p&gt;关键发现：&lt;strong&gt;所有 408/408 输出都是有效的 typed answer，零格式错误&lt;/strong&gt;。通过约束解码直接在 Logit 层拦截非法 token，格式合法性同样可以数学保证。&lt;/p&gt;
&lt;p&gt;扩散路线的成本估算：&lt;strong&gt;$0.0361/千文档&lt;/strong&gt;（H100 上），与 Jev 的 $0.042/M tokens 定价在不同维度上。&lt;/p&gt;
&lt;h3 id=&#34;路线的意义&#34;&gt;路线的意义&lt;/h3&gt;
&lt;p&gt;DiffusionGemma 方案证明了&lt;strong&gt;非自回归语言模型天然适合 System One 范式&lt;/strong&gt;。扩散模型不需要逐 token 解码，可以在任意去噪步骤后读取已稳定的 Logit。这意味着：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;如果你需要更高的判断质量，就多走几步去噪&lt;/li&gt;
&lt;li&gt;如果你只需要快速决策，就 1-step 截断&lt;/li&gt;
&lt;li&gt;同一个模型可以同时提供 System One 和传统的 System 2 生成能力&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;4-llm-路线semif浏览器里的-logit-读取实验&#34;&gt;4. LLM 路线：SemIf——浏览器里的 Logit 读取实验&lt;/h2&gt;
&lt;p&gt;SemIf（原名 OpenJev，由 workszop 开发）是这个生态里&lt;strong&gt;最出圈&lt;/strong&gt;的项目。它登上 Hacker News 首页拿到 556 票，245 条讨论。&lt;/p&gt;
&lt;h3 id=&#34;核心思想&#34;&gt;核心思想&lt;/h3&gt;
&lt;p&gt;在浏览器加载一个 Qwen3-0.6B 的 GGUF 量化版本（~639MB），然后用两种方式比较同一个模型做决策：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Direct Readout&lt;/strong&gt;：从模型的最后一层 Logit 中直接读取候选标签的归一化概率——单 token 读取，不生成任何额外文本&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Generation&lt;/strong&gt;：让模型自回归地生成一个 JSON 格式的概率分布——完全标准的 LLM 调用&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;结果一目了然：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;指标&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Direct Readout&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Generation&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;延迟（RTX 3090）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;0.704 s&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;3-5x 更慢&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;格式错误率&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;0%&lt;/strong&gt;（数学保证）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;需解析 JSON&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;是否需要 LLM 生成&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;❌ 单 token 读取&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;✅ 完整解码&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;是否需 GPU&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;是（WebGPU）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;是（WebGPU）&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;SemIf 的页面设计了非常直观的交互：左边是 Direct Readout 的条形图显示每个选项的概率，右边是 Generation 的输出和计时。你可以自己添加/删除选项，实时体验差距。&lt;/p&gt;
&lt;h3 id=&#34;关键发现不是模型的问题是范式的问题&#34;&gt;关键发现：不是模型的问题，是范式的问题&lt;/h3&gt;
&lt;p&gt;SemIf 最深刻的洞察是：&lt;strong&gt;同一个模型（Qwen3-0.6B），通过 Direct Readout 和 Generation 输出的概率分布可以完全不同&lt;/strong&gt;。因为生成路径需要模型「自我报告」概率——模型需要先想好答案，再把它写成 JSON——这个过程引入了额外的偏差和格式压力。&lt;/p&gt;
&lt;p&gt;Direct Readout 则绕过所有中间表示，直接从最后一层的语义表示中读取该 token 的 Logit。它更快，而且&lt;strong&gt;不可能格式错误&lt;/strong&gt;。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;「这实际上是对 Jev 核心论点的直接证明：如果你只需要判断，不要生成文本。即使是非常小的模型（0.6B），直接读取 Logit 也能在结构化任务上给出有用的分布。」&lt;/p&gt;&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id=&#34;5-中文路线zhihzopenjev&#34;&gt;5. 中文路线：zhihz/openjev&lt;/h2&gt;
&lt;p&gt;zhihz/openjev 是中文社区的直接回应。基于 Qwen3-4B-Instruct，用 MLX 在 Apple Silicon 上运行，支持中文和英文输入。&lt;/p&gt;
&lt;p&gt;核心差异：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;真正的双语&lt;/strong&gt;：英文 + 简体中文，Prompt 和候选标签均支持&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;本地运行&lt;/strong&gt;：Apple M3 + 16GB 内存即可&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Web 界面&lt;/strong&gt;：内置 UI 支持编辑示例、多问题并发、JSON 导出&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;但作者也诚实标注了当前的局限：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;后端是 Qwen3-4B 的&lt;strong&gt;通用指令模型&lt;/strong&gt;，不是专门训练的决策模型&lt;/li&gt;
&lt;li&gt;问题目前是顺序执行的（共享上下文编码的并行化尚未实现）&lt;/li&gt;
&lt;li&gt;没有宣称比直接调用 LLM 有精度或速度优势&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这意味着 zhihz/openjev 更像一个&lt;strong&gt;工程演示&lt;/strong&gt;——展示如何将 LLM 的输出约束为决策接口——而不是一个真正的「复刻」。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;6-benchmark-乱局谁真的超越了-jev&#34;&gt;6. Benchmark 乱局：谁真的超越了 Jev？&lt;/h2&gt;
&lt;p&gt;OpenJev 生态里最热门的叙事是「Verdict 2.0 以 151M 参数超越 Jev」。但这个说法需要仔细拆解。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;明面宣称&lt;/th&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;实际限制&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Verdict 2.0 准确率 77.10% &amp;gt; Jev 72.70%&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Benchmark 数据集 &lt;code&gt;LocalLLaMA/typed-decisions&lt;/code&gt; 不是 Jev 的评估集&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Verdict 2.0 ECE 1.44% &amp;laquo; Jev 14.4%&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Jev 的 ECE 来自其官方 jaggedness 文档，但 Jev 也在持续改进&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Verdict 2.0 延迟 ~25ms &amp;lt; Jev ~140ms&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Jev 的 140ms 包含网络传输，Verdict 的 25ms 仅是本地推理&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Verdict 2.0 训练成本 $0（消费级 GPU 8.8 小时）&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Jev 的 RLCD 训练成本未公开&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;TypeSafe AI 有一个明确的哲学立场：&lt;strong&gt;「不发布公开 Benchmark 成绩，也不鼓励社区用公开 Benchmark 对比。」&lt;/strong&gt; 他们甚至写了一篇博客叫 Antibenchmaxxing，论述为什么以 Benchmark 为中心会扭曲研究。&lt;/p&gt;
&lt;p&gt;所以「超越了 Jev」这个说法在工程上有趣，但在科学上几乎是不可验证的——除非有人拿到同一个私有评估集，或者 TypeSafe 开放他们的 Workflow Eval 集。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;7-三条路线的工程对比&#34;&gt;7. 三条路线的工程对比&lt;/h2&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;维度&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;编码器路线（Verdict）&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;扩散路线（DiffusionGemma）&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;LLM 路线（SemIf/zhihz）&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;架构&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;纯编码器（非自回归）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;扩散语言模型&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;自回归 LLM + Logit 读取&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;参数&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;149.6M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26B (A4B)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.6B-4B&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;推理速度&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~20-35ms&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~150ms&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~700ms-2s&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;GPU 需求&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;任意 GPU（6GB VRAM）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;H100 80GB&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;RTX 3090 / M3&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;类型安全&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;数学保证&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;约束解码保证&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;约束解码保证&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;候选上限&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~25&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;灵活&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;灵活&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;校准&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;专用双通道&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;未专门校准&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;原始 Logit 未校准&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;训练&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;需 RLCD 风格训练&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;无需（零样本）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;无需（零样本）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;语言&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;英文&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;英文&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;中英双语&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;可部署性&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;生产就绪&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;实验性&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;演示/教育&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;没有一条路线在所有维度上领先。选择取决于你的约束条件：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;如果你要在生产环境中做高频率决策（&amp;gt;100 QPS）、GPU 有限、只需要英文&lt;/strong&gt; → Verdict 路线最务实&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;如果你需要零训练成本、最高判断质量、有 H100 资源&lt;/strong&gt; → DiffusionGemma 路线值得试&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;如果你要快速验证概念、做双语或教育演示&lt;/strong&gt; → SemIf/zhihz 路线最佳&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;8-工程启示为什么-openjev-生态会爆炸&#34;&gt;8. 工程启示：为什么 OpenJev 生态会爆炸？&lt;/h2&gt;
&lt;p&gt;Jev 发布不到一周就出现 8 个复刻项目，这个速度本身就值得思考。&lt;/p&gt;
&lt;h3 id=&#34;洞见一决策是比生成更容易复制的接口&#34;&gt;洞见一：「决策」是比「生成」更容易复制的接口&lt;/h3&gt;
&lt;p&gt;LLM 的「生成」能力依赖大规模预训练数据、RLHF 对齐、数万张 GPU。Jev 的核心创新是接口层面的——&lt;strong&gt;不是模型更强了，而是模型被迫输出的东西更少了&lt;/strong&gt;。一旦理解了「单次 Logit 读取」这个 trick，任何 LLM 或编码器都可以装上这个接口。&lt;/p&gt;
&lt;p&gt;SemIf 用 0.6B 模型证明了这一点。Verdict 用 151M 的编码器论证了「专用胜过通用」。&lt;/p&gt;
&lt;h3 id=&#34;洞见二typesafe-真正的护城河可能是-rlcd-训练数据&#34;&gt;洞见二：TypeSafe 真正的护城河可能是 RLCD 训练数据&lt;/h3&gt;
&lt;p&gt;Verdict 2.0 的 Benchmark 成绩虽然惊艳，但它依赖的是 &lt;code&gt;LocalLLaMA/typed-decisions&lt;/code&gt;——一个 2000 条的企业决策数据集。Jev 背后是 TypeSafe 自研的合成数据 pipeline，他们明确定义自己为「primarily a data research lab」。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;数据，而不是架构，可能是这个领域真正的护城河。&lt;/strong&gt;&lt;/p&gt;
&lt;h3 id=&#34;洞见三agent-基础设施正在吃掉这些能力&#34;&gt;洞见三：Agent 基础设施正在吃掉这些能力&lt;/h3&gt;
&lt;p&gt;OpenJev 生态快速膨胀的原因之一是 agent 开发者的直接需求。我在上一篇中提到 Jev 对路由层、护栏、验证的影响——OpenJev 项目正在把这些能力从 API 调用变成可部署的本地服务。&lt;/p&gt;
&lt;p&gt;Verdict 2.0 明确列出了 MCP 工具选择、实时 Agent 护栏、高频率状态循环等场景。这不是巧合，这是 agent 基础设施在寻找自己的「条件判断函数」。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;9-总结未来是属于-system-one-的但不会只有-jev&#34;&gt;9. 总结：未来是属于 System One 的，但不会只有 Jev&lt;/h2&gt;
&lt;p&gt;Jev 的开创性贡献不是它的模型——而是它定义的&lt;strong&gt;接口&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这个接口——&lt;code&gt;State + Questions → Typed Answers with Probabilities&lt;/code&gt;——可能会成为 AI 领域的 REST API：一个足够通用的契约，让不同技术栈在不同硬件上实现同一个承诺。&lt;/p&gt;
&lt;p&gt;OpenJev 生态已经证明了三条独立的技术路线都可以收敛到这个接口上。未来 12 个月，我们很可能会看到：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;编码器路线&lt;/strong&gt;向更大上下文和更多候选发展（ModernBERT-large, 更长位置编码）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;扩散路线&lt;/strong&gt;通过更多去噪步获得更好的校准&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;LLM 路线&lt;/strong&gt;作为「回退方案」——同一个模型同时提供 System One（Logit 读取）和 System 2（生成）能力&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Agent 框架&lt;/strong&gt;原生集成 System One 接口作为标准组件&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这个领域正在发生的事情，不只是 Jev 被复刻——而是整个 AI 行业在重新思考：&lt;strong&gt;当模型不需要「说话」时，我们能省下多少成本、快多少？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;答案可能是「两个数量级」。那个未来值得我们去建。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;strong&gt;关于作者&lt;/strong&gt;：万戈（Chengqi），AI Infra 工程师，前华为/万翼，现构建 MCPZERO（Agent 工具协议）、ClawGuard（Agent 行为安全）和 NanoRuntime（轻量级 Agent Runtime）。&lt;/p&gt;
</description>
        </item>
        <item>
        <title>TypeSafe AI Jev 深度解析：放弃文本生成的「System One 模型」凭什么这么火？</title>
        <link>https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive/</link>
        <pubDate>Mon, 21 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive/cover.svg" alt="Featured image of post TypeSafe AI Jev 深度解析：放弃文本生成的「System One 模型」凭什么这么火？" /&gt;&lt;p&gt;如果你这几天刷 AI 新闻，一定看到了这个名字：&lt;strong&gt;Jev&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;TypeSafe AI 在 9 月 15 日发布了它，然后整个圈子炸了——不是因为它又一个「超越 GPT」的 Benchmark 跑分，而是因为它&lt;strong&gt;从根本上重新定义了一个 AI 模型应该输出什么&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;Jev 不能聊天。不能写代码。没有推理链。你给它一段客户投诉，问三个问题：这是紧急吗？该转哪个部门？客户情绪多差？它&lt;strong&gt;并行回答所有问题&lt;/strong&gt;，70–500 毫秒内返回带概率的结构化结果，你的代码直接分支——不需要解析 JSON、不需要重试、不需要 Schema 验证。&lt;/p&gt;
&lt;p&gt;这不是又一个更小更快的 GPT。Jev 的架构、训练目标、采样策略全部不同。TypeSafe 称之为 &lt;strong&gt;System One 模型&lt;/strong&gt;，我认为这是 2026 年最有意思的 AI 发布之一。&lt;/p&gt;
&lt;p&gt;这篇文章从架构原理、训练方法、实际能力到基础设施影响，帮你全面拆解。&lt;/p&gt;
&lt;h2 id=&#34;1-什么是-system-one-模型&#34;&gt;1. 什么是 System One 模型&lt;/h2&gt;
&lt;p&gt;名字来自丹尼尔·卡尼曼的《思考，快与慢》：System 1 是快而直觉的，System 2 是慢而深思的。传统 LLM 是 System 2——逐 token 自回归生成文本。Jev 是 System 1——读一段状态（state），输出一个判断，&lt;strong&gt;单次并行前向传播完成&lt;/strong&gt;。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;LLM (System 2)&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Jev (System One)&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;训练信号&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;RLHF — 优化人类偏好&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;RLCD — 优化校准决策&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;输出&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;生成文本（字符串）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;带概率的 typed 结构化值&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;采样&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;顺序逐 token&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;并行&lt;/strong&gt;，所有输出一次完成&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;速度&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;3–329 秒（前沿模型）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;70–500 ms&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;成本&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.20–$10 / M 输入 tokens，输出约 5x 更贵&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$0.042 / M 输入 tokens，输出免费&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;类型安全&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;需解析+验证，仍可能幻觉格式&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;数学上保证类型正确&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;置信度&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;过度自信且不一致&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;校准的&lt;/strong&gt;：高置信度 = 高准确率&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;典型用例&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;聊天、代码生成、推理链&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;分类、路由、评分、验证&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;TypeSafe 在 workflow evals 上的数据是：&lt;strong&gt;比前沿 LLM 快 193.6 倍，便宜 444.6 倍&lt;/strong&gt;。他们发布的 Pareto 图显示 Jev 在结构化决策任务上处于完全独立的曲线——任何价位的 LLM 都无法在速度+准确率组合上匹配。&lt;/p&gt;
&lt;h2 id=&#34;2-架构核心并行采样&#34;&gt;2. 架构核心：并行采样&lt;/h2&gt;
&lt;p&gt;最根本的架构差异是&lt;strong&gt;并行采样&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;传统 LLM 逐 token 生成：token N+1 依赖 token 0..N。要输出一个结构化决策（比如从 5 个选项中分类并给出概率），模型必须先产出一长串描述答案的 token——每一个 token 都是潜在的幻觉点。&lt;/p&gt;
&lt;p&gt;Jev 反过来。给定一个 &lt;code&gt;state&lt;/code&gt; 和一组 &lt;code&gt;questions&lt;/code&gt;，它在&lt;strong&gt;单次前向传播中并行评估每个问题&lt;/strong&gt;。输出是固定形状的 typed 结构：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Noul&lt;/strong&gt;：一个 &lt;code&gt;[0, 1]&lt;/code&gt; 浮点数，代表「是」的概率&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Choice&lt;/strong&gt;：选中选项 + 所有选项的概率分布 + 置信度&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Score&lt;/strong&gt;：概率加权得分 + 每级概率 + 置信度&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因为输出形状在请求时就固定了，&lt;strong&gt;类型错误在数学上不可能发生&lt;/strong&gt;。不存在幻觉出畸形 JSON 键或错误闭合括号的 token。&lt;/p&gt;
&lt;p&gt;这对 agent 基础设施的意义巨大：你的代码不需要解析、验证、重试或 Schema 强制。&lt;code&gt;response.answers[&amp;quot;department&amp;quot;].choice&lt;/code&gt; 永远是 criteria 集合中的有效字符串。这是 AI 最接近「永远正确工作的函数调用」的一次。&lt;/p&gt;
&lt;h2 id=&#34;3-rlcd真正的训练秘密&#34;&gt;3. RLCD：真正的训练秘密&lt;/h2&gt;
&lt;p&gt;TypeSafe 最重要的创新可能不是架构，而是 &lt;strong&gt;RLCD（Reinforcement Learning for Calibrated Decisions）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;每个主要 LLM 实验室都用某种 RLHF：训练一个基于人类偏好的奖励模型，然后最大化这个奖励。创始人 Diogo Almeida 说得直白：「生成人类标注者更喜欢的文本」对自动化来说是&lt;strong&gt;错误的优化目标&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;RLVR（Reinforcement Learning with Verifiable Rewards）用程序化可验证的奖励信号部分解决了数学和代码的问题。但大多数现实世界的判断任务不适合这种形状——结果就是「尖峰智能」：在可验证 Benchmark 上表现好，在细微决策上不稳定。&lt;/p&gt;
&lt;p&gt;RLCD 优化的是&lt;strong&gt;校准度（calibration）&lt;/strong&gt;：模型输出的概率应该匹配真实结果频率。当 Jev 说一个工单有 85% 概率属于「技术」类别时，在所有这样的判断中，大约 85% 应该确实是技术类。校准曲线（ECE、可靠性图）直接衡量这个指标，RLCD 直接优化它。&lt;/p&gt;
&lt;p&gt;这和「让模型产出一条推理链然后希望结论正确」有本质区别。Jev 不推理——它&lt;strong&gt;判断&lt;/strong&gt;。训练数据是 TypeSafe 自己合成的（他们自称为「主要是数据研究实验室」），RLCD 过程在 System One 任务上迭代改进校准度。&lt;/p&gt;
&lt;h2 id=&#34;4-三个原语noul-choice-score&#34;&gt;4. 三个原语：Noul, Choice, Score&lt;/h2&gt;
&lt;p&gt;TypeSafe 恰好暴露三种问题类型，每种对应一种基本的决策形状：&lt;/p&gt;
&lt;h3 id=&#34;noul是否型&#34;&gt;Noul（是否型）&lt;/h3&gt;
&lt;p&gt;最简单的原语。问一个二值问题，返回概率 &lt;code&gt;[0, 1]&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;用途：内容审核、护栏触发、相关性过滤、大规模二值分类。&lt;/p&gt;
&lt;h3 id=&#34;choicen-选一&#34;&gt;Choice（N 选一）&lt;/h3&gt;
&lt;p&gt;从最多 255 个候选中选一个，返回完整概率分布 + 置信度。&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-json&#34; data-lang=&#34;json&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;{
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;department&amp;#34;&lt;/span&gt;: {
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;type&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;choice&amp;#34;&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;choice&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;technical&amp;#34;&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;confidence&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.78&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;probabilities&amp;#34;&lt;/span&gt;: {
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;      &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;technical&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.85&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;      &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;sales&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.0&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;      &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;billing&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.15&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    }
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  }
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;}
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;用途：意图路由、工单分类、模型选择、链接选择（Wikiracing demo 每步从 ~100 个链接中选）。&lt;/p&gt;
&lt;h3 id=&#34;score评分型&#34;&gt;Score（评分型）&lt;/h3&gt;
&lt;p&gt;在一组有序级别（2–10 级）上返回概率加权连续分数。&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-json&#34; data-lang=&#34;json&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;{
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;frustration&amp;#34;&lt;/span&gt;: {
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;type&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;score&amp;#34;&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;score&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;1.0&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;confidence&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;1.0&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;probabilities&amp;#34;&lt;/span&gt;: { &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;0&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.0&lt;/span&gt;, &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;1&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;1.0&lt;/span&gt;, &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;2&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.0&lt;/span&gt; }
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  }
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;}
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;用途：情感评分、质量评级、严重程度评估、复合评分（多个原子分数后在代码中组合）。&lt;/p&gt;
&lt;h2 id=&#34;5-置信度契约&#34;&gt;5. 置信度契约&lt;/h2&gt;
&lt;p&gt;Confidence 是 Jev 最被低估的杀手特性。&lt;/p&gt;
&lt;p&gt;Choice 答案不仅返回选了什么，还返回&lt;strong&gt;模型对这个选择有多确定&lt;/strong&gt;。置信度从概率分布计算：0.0（均匀分布——模型完全没把握）到 1.0（所有概率质量集中在一个选项）。&lt;/p&gt;
&lt;p&gt;这开启了一种 TypeSafe 称为 &lt;strong&gt;confidence-gated routing&lt;/strong&gt; 的模式：你的代码检查 &lt;code&gt;if answer.confidence &amp;gt; 0.8: 自动处理; else: 升级到人类或昂贵 LLM&lt;/code&gt;。不需要 Prompt 工程。不需要「你确定吗？」重试。模型在不确定时就告诉你。&lt;/p&gt;
&lt;p&gt;对 agent 基础设施来说，这是变革性的。当前的 agent 循环浪费大量计算在确定性的重试逻辑、确认 Prompt 和解析重试周期上。置信度门控架构在推理层面消除了大部分这种开销。&lt;/p&gt;
&lt;h2 id=&#34;6-两个-demodoom-和-wikiracing&#34;&gt;6. 两个 Demo：Doom 和 Wikiracing&lt;/h2&gt;
&lt;h3 id=&#34;doom10-次秒的实时决策&#34;&gt;Doom：10 次/秒的实时决策&lt;/h3&gt;
&lt;p&gt;Jev 通过评估游戏状态（敌人位置、血量、弹药、附近道具）来玩 Doom，以约 10 次查询/秒的速度选择动作。成本：约 &lt;strong&gt;$7/小时&lt;/strong&gt;。模型不在像素上运行——游戏状态被预解析为结构化文本——但延迟预算符合实时游戏要求。&lt;/p&gt;
&lt;p&gt;核心洞察：没有 LLM 能以商品化定价维持每秒 10 次结构化决策。这不仅是速度和成本问题，更是&lt;strong&gt;架构问题&lt;/strong&gt;——Jev 的并行评估让它在同一前向传播中处理多个决策，而 LLM 必须为每个动作生成一串 token。&lt;/p&gt;
&lt;h3 id=&#34;wikiracing无需解析的路由&#34;&gt;Wikiracing：无需解析的路由&lt;/h3&gt;
&lt;p&gt;从一篇 Wikipedia 文章出发，只用超链接导航到目标页面。每一步需要从数百个链接中选一个。Jev 评估每个链接的相关性并选一个。&lt;/p&gt;
&lt;p&gt;关键洞察：&lt;strong&gt;Jev 永远不会幻觉出不存在的链接&lt;/strong&gt;——这是 LLM 在高基数选择中常见的失败模式。利用 Choice 的 255 选项限制和更大候选集的 2 阶段评分，模型始终用更少的步数到达目标。&lt;/p&gt;
&lt;h2 id=&#34;7-已知缺陷jev-不能做什么&#34;&gt;7. 已知缺陷：Jev 不能做什么&lt;/h2&gt;
&lt;p&gt;TypeSafe 发布了一份相当坦诚的 &lt;strong&gt;「jaggedness」文档&lt;/strong&gt;。以下是真实限制：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;字面阅读&lt;/strong&gt;：Jev 回答你写的问题，不是你想问的。否定、隐含条件、作用域词都按字面理解。如果指令说「客户既生气又要求退款」而只有一个条件满足，Jev 可能基于部分重叠回答。&lt;strong&gt;规避&lt;/strong&gt;：分解为独立问题。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;不能数学和计数&lt;/strong&gt;：Jev 不能可靠计数。在 8 个项目的列表中问「几个是水果」会失败。&lt;strong&gt;规避&lt;/strong&gt;：每个项目一个 Noul，在代码中求和。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;不能比较日期和时间&lt;/strong&gt;：日期被视为文本，不是有序量。混合格式和时区边界特别不稳定。&lt;strong&gt;规避&lt;/strong&gt;：用 Choice 提取组件，在代码中比较。TypeSafe 提供了一个日期提取 cookbook。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;不支持间接推理&lt;/strong&gt;：双重否定或属性之属性会降低准确率。&lt;strong&gt;规避&lt;/strong&gt;：写最直接的问题。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;对大状态敏感&lt;/strong&gt;：准确率随着与决策无关的内容增多而下降。&lt;strong&gt;规避&lt;/strong&gt;：代码中先检索和过滤相关字段。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;不处理图像&lt;/strong&gt;：目前仅文本输入。Doom demo 将游戏状态预解析为结构化文本。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;语言偏差&lt;/strong&gt;：英语是主要训练语言，准确率最好。中日韩及其他语言「效果不那么好」。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这些不是致命伤——它们是&lt;strong&gt;不同范式的边界&lt;/strong&gt;。LLM 在这些方面也会失败，但失败的信号被流畅的文本掩盖了。Jev 的失败是透明的（低置信度、错误概率），因而更容易管理。&lt;/p&gt;
&lt;h2 id=&#34;8-对-agent-基础设施的影响&#34;&gt;8. 对 Agent 基础设施的影响&lt;/h2&gt;
&lt;p&gt;对于正在构建 agent 基础设施的人（包括 MCPZERO 和 NanoRuntime 的我们），Jev 改变了几个关键子系统的计算：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;路由层&lt;/strong&gt;：不再用单个 LLM 调用来决定意图。部署 Jev 作为预路由器——70–500ms、$0.042/Mtok、零解析开销、置信度门控升级到更强模型。这是我所见过最干净的「分类器 → 专家」架构。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;护栏&lt;/strong&gt;：Jev 比现有护栏模型更快更便宜。每个检查一个 Noul 问题（检测到劫持？泄露了 PII？违反策略？）在同一调用中运行，增加可忽略的延迟。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;验证&lt;/strong&gt;：用 Jev 评分任何其他 LLM 的输出。「这个答案引用了证据吗？评分 0–2。」「这个推理链逻辑一致吗？Noul。」以生成式调用 1/400 的成本，你可以验证生产中的每个 LLM 输出。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Agent 行为 Map-Reduce&lt;/strong&gt;：100 倍更便宜意味着你可以对 agent 会话的每一步进行分类、评分和特征提取——构建支持类似 ClawGuard 的可观测性和安全工具所需的行为数据集。&lt;/p&gt;
&lt;h2 id=&#34;9-更大的图景jevons-paradox&#34;&gt;9. 更大的图景：Jevons Paradox&lt;/h2&gt;
&lt;p&gt;TypeSafe 将模型命名为 Jev 是为了纪念 &lt;strong&gt;William Stanley Jevons&lt;/strong&gt;——他观察到煤的使用效率提高导致了&lt;strong&gt;更多的煤消费&lt;/strong&gt;，而不是更少——因为更便宜的能源解锁了新用例。&lt;strong&gt;Jevons Paradox&lt;/strong&gt; 是团队明确的赌注：当 AI 判断便宜 400 倍时，软件自动化的决策数量会&lt;strong&gt;爆发式增长&lt;/strong&gt;，而不是收缩。&lt;/p&gt;
&lt;p&gt;如果这个假设成立，未来不是一个巨大的聊天模型运行一切。它是一个分层架构：Jev 类模型在边缘做快速、廉价、校准的决策；更强的 LLM 保留给深度推理、创意生成和人类交互；中间的代码控制流程。&lt;/p&gt;
&lt;p&gt;这是一个值得为之构建的未来。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;strong&gt;关于作者&lt;/strong&gt;：万戈（Chengqi），AI Infra 工程师，前华为/万翼，现构建 MCPZERO（Agent 工具协议）、ClawGuard（Agent 行为安全）和 NanoRuntime（轻量级 Agent Runtime）。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
