<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>OpenJev on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/openjev/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Mon, 21 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/openjev/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>OpenJev 生态全景解析：当社区用 151M 参数在浏览器里复刻 Jev 的「System One」范式</title>
        <link>https://www.yesmiracle.net/post/20260921-openjev-ecosystem-deep-dive/</link>
        <pubDate>Mon, 21 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260921-openjev-ecosystem-deep-dive/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260921-openjev-ecosystem-deep-dive/cover.svg" alt="Featured image of post OpenJev 生态全景解析：当社区用 151M 参数在浏览器里复刻 Jev 的「System One」范式" /&gt;&lt;p&gt;如果你看了上一篇 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive&#34; &gt;Jev 的深度解析&lt;/a&gt;，应该已经理解了 TypeSafe AI 为什么放弃文本生成——并行采样、RLCD 训练、数学保证的类型安全——这些让 Jev 在结构化决策任务上比 LLM 快 200 倍、便宜 400 倍。&lt;/p&gt;
&lt;p&gt;然后有趣的事情发生了。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Jev 发布不到一周，开源社区里至少涌现出 8 个独立项目，试图用不同的技术路线复刻 Jev 的「System One」范式。&lt;/strong&gt; 有人用 ModernBERT + GLiClass 搭了个 151M 参数的纯编码器决策引擎，在公开 Benchmark 上宣称超越了 Jev 本身。有人往浏览器里灌了个 Qwen3-0.6B，让任何人免费在本地 GPU 上对比直接 Logit 读取和逐 token 生成的差距。还有人用 Google 的 DiffusionGemma 做并行决策，单步推理达成 90.8% 的 Jev 一致率。&lt;/p&gt;
&lt;p&gt;这不是开源社区在「山寨」一个 API。这是在用不同的技术栈验证同一个洞见：&lt;strong&gt;「AI 不需要会说话，会判断就够了。」&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这篇文章系统地梳理 OpenJev 生态——从技术路线、性能数据到工程启示。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-全景图八个项目三条技术路线&#34;&gt;1. 全景图：八个项目，三条技术路线&lt;/h2&gt;
&lt;p&gt;OpenJev 不是一个项目，而是一个&lt;strong&gt;快速扩散的生态系统&lt;/strong&gt;。我按底层技术路线把它们分为三类：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;分类&lt;/th&gt;
          &lt;th&gt;项目&lt;/th&gt;
          &lt;th&gt;核心模型&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;参数&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;路线&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;编码器路线&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;OpenJev Verdict 1.4&lt;/td&gt;
          &lt;td&gt;ModernBERT-base + GLiClass&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;151M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;双向编码器 + 分类头&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;/td&gt;
          &lt;td&gt;openJev-verdict-2.0&lt;/td&gt;
          &lt;td&gt;ModernBERT-base + 双通道&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;149.6M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;编码器 + 双校准通道&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;/td&gt;
          &lt;td&gt;Laya（参考）&lt;/td&gt;
          &lt;td&gt;ModernBERT-large&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;421M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;更大的编码器基线&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;扩散路线&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;JoshuaSP/open-jev&lt;/td&gt;
          &lt;td&gt;DiffusionGemma 26B-A4B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;扩散去噪 + Logit 约束&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;/td&gt;
          &lt;td&gt;razorback16/openjev&lt;/td&gt;
          &lt;td&gt;DiffusionGemma 26B-A4B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;同上的决策服务封装&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;LLM 路线&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;SemIf (workszop/openjev)&lt;/td&gt;
          &lt;td&gt;Qwen3-0.6B (GGUF)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.6B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;Browser WebGPU + Logit 读取&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;/td&gt;
          &lt;td&gt;zhihz/openjev&lt;/td&gt;
          &lt;td&gt;Qwen3-4B-Instruct&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;4B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;本地 MLX 推理&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;/td&gt;
          &lt;td&gt;TheoLeeCJ/openjev&lt;/td&gt;
          &lt;td&gt;多种开放模型&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;可变&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;LLM 分类头读取&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;商业&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;openjev.sh&lt;/td&gt;
          &lt;td&gt;N/A&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;N/A&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;付费代理 + $JEV 代币&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;三条路线的哲学完全不同。下面逐一拆解。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-编码器路线openjev-verdict151m-的纯判断引擎&#34;&gt;2. 编码器路线：OpenJev Verdict——151M 的纯判断引擎&lt;/h2&gt;
&lt;h3 id=&#34;架构&#34;&gt;架构&lt;/h3&gt;
&lt;p&gt;Verdict 是当前最「认真」的 OpenJev 项目。它不是把 LLM 拿来改 Prompt，而是&lt;strong&gt;从零用编码器搭了一个纯判断模型&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;核心组件：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;ModernBERT-base&lt;/strong&gt;（149.6M 参数）：Answer.AI 和 LightOn 联合研发的高效编码器，支持 8192 token 上下文，原生 unpadding，训练效率比旧版 BERT 高 4 倍&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLiClass 分类头&lt;/strong&gt;：bi-encoder 架构，将文档和候选标签联合编码后计算相似度&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;RLCD 风格训练&lt;/strong&gt;：用 Brier Score 等校准指标做优化信号&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;推理过程是&lt;strong&gt;非自回归&lt;/strong&gt;的：输入文档 + 候选标签列表 → ModernBERT 单次前向传播 → 分类头计算所有候选的 Logit → Softmax 归一化 → 直接输出概率分布。整个过程 &lt;strong&gt;20–35 毫秒&lt;/strong&gt;完成。&lt;/p&gt;
&lt;h3 id=&#34;verdict-14-的修复故事&#34;&gt;Verdict 1.4 的修复故事&lt;/h3&gt;
&lt;p&gt;V1.0 有几个低级但关键的工程缺陷：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Calibrator 没加载&lt;/strong&gt;：推理引擎在独立运行时忘了加载 &lt;code&gt;calibrator.json&lt;/code&gt;，实际上在用未校准的 temperature 1.0 瞎蒙&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;候选标签格式不匹配&lt;/strong&gt;：GLiClass 基座来自自然语言推理（NLI），期望标签写成假设句（&amp;ldquo;It is {description}&amp;quot;），但引擎直接送裸名词短语&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;上下文窗口过大&lt;/strong&gt;：训练数据的上下文平均 71 tokens，推理时却允许 1024，导致分布外漂移&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;V1.4 修复后，Standard 难度准确率从 62.5% → 69.4%（+6.9%），Hard 难度校准误差从 0.298 → 0.118（-60.4%）。这是一个很好的案例：&lt;strong&gt;即使架构对了，粗心的推理工程也能毁掉一切&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id=&#34;verdict-20151m-击败-421m&#34;&gt;Verdict 2.0：151M 击败 421M&lt;/h3&gt;
&lt;p&gt;Verdict 2.0 在 &lt;code&gt;LocalLLaMA/typed-decisions&lt;/code&gt; 这个企业级决策 Benchmark（2000 条金融/安全/客服/Agent Trace 数据）上交出了令人侧目的成绩：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;模型&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;参数量&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Top-1 准确率&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Brier Loss&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;ECE&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;延迟&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;Verdict 2.0&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;149.6M&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;77.10%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;0.0636&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1.44%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~20-25ms&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Laya&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;421.3M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;76.60%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.0660&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~31ms&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;TypeSafe Jev 1.13&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~150M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;72.70%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.1480&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;14.4%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~140ms&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;TF-IDF + LR&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;66.10%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.1520&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;2.07%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~8ms&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Verdict 1.0 基线&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;149.6M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26.10%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.5851&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;42.09%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~35ms&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;几个值得注意的点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Verdict 2.0 的准确率（77.10%）&lt;strong&gt;超过了 Jev 本身（72.70%）&lt;/strong&gt;。但要注意：Benchmark 数据集是 &lt;code&gt;LocalLLaMA/typed-decisions&lt;/code&gt;，不是 Jev 的 workflow evals。TypeSafe 明确拒绝在公开 Benchmark 上评测，所以这不是 apples-to-apples 对比。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;TF-IDF + Logistic Regression 拿到 66.10%&lt;/strong&gt;，说明这个数据集里相当一部分决策可以通过简单词频特征解决。Verdict 2.0 多出的 11% 来自需要深层语义判断的边界样本。&lt;/li&gt;
&lt;li&gt;Verdict 2.0 的双通道校准（Correctness Head + Distribution Channel）把 ECE 降到了 1.44%，这是&lt;strong&gt;数学上比 Jev 更好的校准度&lt;/strong&gt;。Jev 的文档里承认 ECE 约 14.4%。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;但是&lt;/strong&gt;：Verdict 2.0 目前只支持最多 25 个候选选项（24 + 1 弃权槽），而 Jev 支持 255。Verdict 的上下文窗口也受限于 ModernBERT 的 8192 token 位置编码。&lt;/p&gt;
&lt;h3 id=&#34;编码器路线的根本局限&#34;&gt;编码器路线的根本局限&lt;/h3&gt;
&lt;p&gt;编码器方案的优势是&lt;strong&gt;快且便宜&lt;/strong&gt;——一次前向传播决定所有事情。但它的上限也很清楚：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;没有推理能力：遇到需要多步推导的决策（「如果 A 且 B 则 C」），编码器要依赖训练数据中的模式覆盖&lt;/li&gt;
&lt;li&gt;不支持开放式输出：只能从预定义的候选中选择，不能动态生成新选项&lt;/li&gt;
&lt;li&gt;语言能力受限：相比在数十亿 token 上训练的 LLM，编码器的语言理解有限&lt;/li&gt;
&lt;li&gt;候选数量上限：25 vs Jev 的 255，差距明显&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;但&lt;strong&gt;如果结构化决策是它唯一的任务&lt;/strong&gt;，这些局限可能根本不成问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-扩散路线diffusiongemma-做并行决策&#34;&gt;3. 扩散路线：DiffusionGemma 做并行决策&lt;/h2&gt;
&lt;p&gt;JoshuaSP/open-jev 走了一条完全不同的路：用 Google 的 &lt;strong&gt;DiffusionGemma 26B-A4B&lt;/strong&gt;（一种非自回归扩散语言模型）来做并行决策。&lt;/p&gt;
&lt;h3 id=&#34;为什么用扩散模型&#34;&gt;为什么用扩散模型？&lt;/h3&gt;
&lt;p&gt;DiffusionGemma 不是逐 token 生成文本，而是从一个随机噪声向量开始，通过多步去噪直接「涌现」出完整输出。这意味着它能在&lt;strong&gt;单步去噪后就读取 Logit 做出决策&lt;/strong&gt;，而不需要走完整个扩散序列。&lt;/p&gt;
&lt;p&gt;对比 Jev 的并行采样与 DiffusionGemma 的扩散采样：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;&lt;/th&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;Jev&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;DiffusionGemma (1-step)&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;采样策略&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;专用并行架构&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;扩散去噪 + Logit 约束&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;单次决策速度&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;70-500ms&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~150ms（含 H100 推理）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;一致性&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;数学保证（原始 Jev）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;90.8%（复刻 337 题）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;类型安全&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;架构保证&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;约束解码保证&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;模型来源&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;私有训练&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;开放权重 26B&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id=&#34;实测结果&#34;&gt;实测结果&lt;/h3&gt;
&lt;p&gt;项目作者在 20 个 Jev 公开用例的 337 个问题上做了对比：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;Workflow&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;原始 1-step&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;分组 1-step&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;分组 2-step&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;原始 Jev&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Agent 跟踪&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;78.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;78.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;80.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;78.8%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;客服&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;91.3%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;82.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;84.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;89.1%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;发票处理&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;92.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;92.2%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;94.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;97.0%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;安全事件&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;69.2%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;73.1%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;73.1%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;80.8%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;&lt;strong&gt;全部&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;88.4%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;86.1%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;87.8%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;90.8%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;分组 2-step 推理比原始方法快 &lt;strong&gt;4.85 倍&lt;/strong&gt;、便宜 &lt;strong&gt;79%&lt;/strong&gt;，正确判断只少了 2 个（337 题中从 298 → 296）。&lt;/p&gt;
&lt;p&gt;关键发现：&lt;strong&gt;所有 408/408 输出都是有效的 typed answer，零格式错误&lt;/strong&gt;。通过约束解码直接在 Logit 层拦截非法 token，格式合法性同样可以数学保证。&lt;/p&gt;
&lt;p&gt;扩散路线的成本估算：&lt;strong&gt;$0.0361/千文档&lt;/strong&gt;（H100 上），与 Jev 的 $0.042/M tokens 定价在不同维度上。&lt;/p&gt;
&lt;h3 id=&#34;路线的意义&#34;&gt;路线的意义&lt;/h3&gt;
&lt;p&gt;DiffusionGemma 方案证明了&lt;strong&gt;非自回归语言模型天然适合 System One 范式&lt;/strong&gt;。扩散模型不需要逐 token 解码，可以在任意去噪步骤后读取已稳定的 Logit。这意味着：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;如果你需要更高的判断质量，就多走几步去噪&lt;/li&gt;
&lt;li&gt;如果你只需要快速决策，就 1-step 截断&lt;/li&gt;
&lt;li&gt;同一个模型可以同时提供 System One 和传统的 System 2 生成能力&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;4-llm-路线semif浏览器里的-logit-读取实验&#34;&gt;4. LLM 路线：SemIf——浏览器里的 Logit 读取实验&lt;/h2&gt;
&lt;p&gt;SemIf（原名 OpenJev，由 workszop 开发）是这个生态里&lt;strong&gt;最出圈&lt;/strong&gt;的项目。它登上 Hacker News 首页拿到 556 票，245 条讨论。&lt;/p&gt;
&lt;h3 id=&#34;核心思想&#34;&gt;核心思想&lt;/h3&gt;
&lt;p&gt;在浏览器加载一个 Qwen3-0.6B 的 GGUF 量化版本（~639MB），然后用两种方式比较同一个模型做决策：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Direct Readout&lt;/strong&gt;：从模型的最后一层 Logit 中直接读取候选标签的归一化概率——单 token 读取，不生成任何额外文本&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Generation&lt;/strong&gt;：让模型自回归地生成一个 JSON 格式的概率分布——完全标准的 LLM 调用&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;结果一目了然：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;指标&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Direct Readout&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Generation&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;延迟（RTX 3090）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;0.704 s&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;3-5x 更慢&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;格式错误率&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;0%&lt;/strong&gt;（数学保证）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;需解析 JSON&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;是否需要 LLM 生成&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;❌ 单 token 读取&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;✅ 完整解码&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;是否需 GPU&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;是（WebGPU）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;是（WebGPU）&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;SemIf 的页面设计了非常直观的交互：左边是 Direct Readout 的条形图显示每个选项的概率，右边是 Generation 的输出和计时。你可以自己添加/删除选项，实时体验差距。&lt;/p&gt;
&lt;h3 id=&#34;关键发现不是模型的问题是范式的问题&#34;&gt;关键发现：不是模型的问题，是范式的问题&lt;/h3&gt;
&lt;p&gt;SemIf 最深刻的洞察是：&lt;strong&gt;同一个模型（Qwen3-0.6B），通过 Direct Readout 和 Generation 输出的概率分布可以完全不同&lt;/strong&gt;。因为生成路径需要模型「自我报告」概率——模型需要先想好答案，再把它写成 JSON——这个过程引入了额外的偏差和格式压力。&lt;/p&gt;
&lt;p&gt;Direct Readout 则绕过所有中间表示，直接从最后一层的语义表示中读取该 token 的 Logit。它更快，而且&lt;strong&gt;不可能格式错误&lt;/strong&gt;。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;「这实际上是对 Jev 核心论点的直接证明：如果你只需要判断，不要生成文本。即使是非常小的模型（0.6B），直接读取 Logit 也能在结构化任务上给出有用的分布。」&lt;/p&gt;&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id=&#34;5-中文路线zhihzopenjev&#34;&gt;5. 中文路线：zhihz/openjev&lt;/h2&gt;
&lt;p&gt;zhihz/openjev 是中文社区的直接回应。基于 Qwen3-4B-Instruct，用 MLX 在 Apple Silicon 上运行，支持中文和英文输入。&lt;/p&gt;
&lt;p&gt;核心差异：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;真正的双语&lt;/strong&gt;：英文 + 简体中文，Prompt 和候选标签均支持&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;本地运行&lt;/strong&gt;：Apple M3 + 16GB 内存即可&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Web 界面&lt;/strong&gt;：内置 UI 支持编辑示例、多问题并发、JSON 导出&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;但作者也诚实标注了当前的局限：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;后端是 Qwen3-4B 的&lt;strong&gt;通用指令模型&lt;/strong&gt;，不是专门训练的决策模型&lt;/li&gt;
&lt;li&gt;问题目前是顺序执行的（共享上下文编码的并行化尚未实现）&lt;/li&gt;
&lt;li&gt;没有宣称比直接调用 LLM 有精度或速度优势&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这意味着 zhihz/openjev 更像一个&lt;strong&gt;工程演示&lt;/strong&gt;——展示如何将 LLM 的输出约束为决策接口——而不是一个真正的「复刻」。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;6-benchmark-乱局谁真的超越了-jev&#34;&gt;6. Benchmark 乱局：谁真的超越了 Jev？&lt;/h2&gt;
&lt;p&gt;OpenJev 生态里最热门的叙事是「Verdict 2.0 以 151M 参数超越 Jev」。但这个说法需要仔细拆解。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;明面宣称&lt;/th&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;实际限制&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Verdict 2.0 准确率 77.10% &amp;gt; Jev 72.70%&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Benchmark 数据集 &lt;code&gt;LocalLLaMA/typed-decisions&lt;/code&gt; 不是 Jev 的评估集&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Verdict 2.0 ECE 1.44% &amp;laquo; Jev 14.4%&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Jev 的 ECE 来自其官方 jaggedness 文档，但 Jev 也在持续改进&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Verdict 2.0 延迟 ~25ms &amp;lt; Jev ~140ms&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Jev 的 140ms 包含网络传输，Verdict 的 25ms 仅是本地推理&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Verdict 2.0 训练成本 $0（消费级 GPU 8.8 小时）&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Jev 的 RLCD 训练成本未公开&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;TypeSafe AI 有一个明确的哲学立场：&lt;strong&gt;「不发布公开 Benchmark 成绩，也不鼓励社区用公开 Benchmark 对比。」&lt;/strong&gt; 他们甚至写了一篇博客叫 Antibenchmaxxing，论述为什么以 Benchmark 为中心会扭曲研究。&lt;/p&gt;
&lt;p&gt;所以「超越了 Jev」这个说法在工程上有趣，但在科学上几乎是不可验证的——除非有人拿到同一个私有评估集，或者 TypeSafe 开放他们的 Workflow Eval 集。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;7-三条路线的工程对比&#34;&gt;7. 三条路线的工程对比&lt;/h2&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;维度&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;编码器路线（Verdict）&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;扩散路线（DiffusionGemma）&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;LLM 路线（SemIf/zhihz）&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;架构&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;纯编码器（非自回归）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;扩散语言模型&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;自回归 LLM + Logit 读取&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;参数&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;149.6M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26B (A4B)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.6B-4B&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;推理速度&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~20-35ms&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~150ms&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~700ms-2s&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;GPU 需求&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;任意 GPU（6GB VRAM）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;H100 80GB&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;RTX 3090 / M3&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;类型安全&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;数学保证&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;约束解码保证&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;约束解码保证&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;候选上限&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;~25&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;灵活&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;灵活&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;校准&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;专用双通道&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;未专门校准&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;原始 Logit 未校准&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;训练&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;需 RLCD 风格训练&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;无需（零样本）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;无需（零样本）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;语言&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;英文&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;英文&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;中英双语&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;可部署性&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;生产就绪&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;实验性&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;演示/教育&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;没有一条路线在所有维度上领先。选择取决于你的约束条件：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;如果你要在生产环境中做高频率决策（&amp;gt;100 QPS）、GPU 有限、只需要英文&lt;/strong&gt; → Verdict 路线最务实&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;如果你需要零训练成本、最高判断质量、有 H100 资源&lt;/strong&gt; → DiffusionGemma 路线值得试&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;如果你要快速验证概念、做双语或教育演示&lt;/strong&gt; → SemIf/zhihz 路线最佳&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;8-工程启示为什么-openjev-生态会爆炸&#34;&gt;8. 工程启示：为什么 OpenJev 生态会爆炸？&lt;/h2&gt;
&lt;p&gt;Jev 发布不到一周就出现 8 个复刻项目，这个速度本身就值得思考。&lt;/p&gt;
&lt;h3 id=&#34;洞见一决策是比生成更容易复制的接口&#34;&gt;洞见一：「决策」是比「生成」更容易复制的接口&lt;/h3&gt;
&lt;p&gt;LLM 的「生成」能力依赖大规模预训练数据、RLHF 对齐、数万张 GPU。Jev 的核心创新是接口层面的——&lt;strong&gt;不是模型更强了，而是模型被迫输出的东西更少了&lt;/strong&gt;。一旦理解了「单次 Logit 读取」这个 trick，任何 LLM 或编码器都可以装上这个接口。&lt;/p&gt;
&lt;p&gt;SemIf 用 0.6B 模型证明了这一点。Verdict 用 151M 的编码器论证了「专用胜过通用」。&lt;/p&gt;
&lt;h3 id=&#34;洞见二typesafe-真正的护城河可能是-rlcd-训练数据&#34;&gt;洞见二：TypeSafe 真正的护城河可能是 RLCD 训练数据&lt;/h3&gt;
&lt;p&gt;Verdict 2.0 的 Benchmark 成绩虽然惊艳，但它依赖的是 &lt;code&gt;LocalLLaMA/typed-decisions&lt;/code&gt;——一个 2000 条的企业决策数据集。Jev 背后是 TypeSafe 自研的合成数据 pipeline，他们明确定义自己为「primarily a data research lab」。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;数据，而不是架构，可能是这个领域真正的护城河。&lt;/strong&gt;&lt;/p&gt;
&lt;h3 id=&#34;洞见三agent-基础设施正在吃掉这些能力&#34;&gt;洞见三：Agent 基础设施正在吃掉这些能力&lt;/h3&gt;
&lt;p&gt;OpenJev 生态快速膨胀的原因之一是 agent 开发者的直接需求。我在上一篇中提到 Jev 对路由层、护栏、验证的影响——OpenJev 项目正在把这些能力从 API 调用变成可部署的本地服务。&lt;/p&gt;
&lt;p&gt;Verdict 2.0 明确列出了 MCP 工具选择、实时 Agent 护栏、高频率状态循环等场景。这不是巧合，这是 agent 基础设施在寻找自己的「条件判断函数」。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;9-总结未来是属于-system-one-的但不会只有-jev&#34;&gt;9. 总结：未来是属于 System One 的，但不会只有 Jev&lt;/h2&gt;
&lt;p&gt;Jev 的开创性贡献不是它的模型——而是它定义的&lt;strong&gt;接口&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这个接口——&lt;code&gt;State + Questions → Typed Answers with Probabilities&lt;/code&gt;——可能会成为 AI 领域的 REST API：一个足够通用的契约，让不同技术栈在不同硬件上实现同一个承诺。&lt;/p&gt;
&lt;p&gt;OpenJev 生态已经证明了三条独立的技术路线都可以收敛到这个接口上。未来 12 个月，我们很可能会看到：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;编码器路线&lt;/strong&gt;向更大上下文和更多候选发展（ModernBERT-large, 更长位置编码）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;扩散路线&lt;/strong&gt;通过更多去噪步获得更好的校准&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;LLM 路线&lt;/strong&gt;作为「回退方案」——同一个模型同时提供 System One（Logit 读取）和 System 2（生成）能力&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Agent 框架&lt;/strong&gt;原生集成 System One 接口作为标准组件&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这个领域正在发生的事情，不只是 Jev 被复刻——而是整个 AI 行业在重新思考：&lt;strong&gt;当模型不需要「说话」时，我们能省下多少成本、快多少？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;答案可能是「两个数量级」。那个未来值得我们去建。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;strong&gt;关于作者&lt;/strong&gt;：万戈（Chengqi），AI Infra 工程师，前华为/万翼，现构建 MCPZERO（Agent 工具协议）、ClawGuard（Agent 行为安全）和 NanoRuntime（轻量级 Agent Runtime）。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
