<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>模型架构 on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/%E6%A8%A1%E5%9E%8B%E6%9E%B6%E6%9E%84/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Mon, 21 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/%E6%A8%A1%E5%9E%8B%E6%9E%B6%E6%9E%84/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>TypeSafe AI Jev 深度解析：放弃文本生成的「System One 模型」凭什么这么火？</title>
        <link>https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive/</link>
        <pubDate>Mon, 21 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260921-typesafe-jev-system-one-deep-dive/cover.svg" alt="Featured image of post TypeSafe AI Jev 深度解析：放弃文本生成的「System One 模型」凭什么这么火？" /&gt;&lt;p&gt;如果你这几天刷 AI 新闻，一定看到了这个名字：&lt;strong&gt;Jev&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;TypeSafe AI 在 9 月 15 日发布了它，然后整个圈子炸了——不是因为它又一个「超越 GPT」的 Benchmark 跑分，而是因为它&lt;strong&gt;从根本上重新定义了一个 AI 模型应该输出什么&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;Jev 不能聊天。不能写代码。没有推理链。你给它一段客户投诉，问三个问题：这是紧急吗？该转哪个部门？客户情绪多差？它&lt;strong&gt;并行回答所有问题&lt;/strong&gt;，70–500 毫秒内返回带概率的结构化结果，你的代码直接分支——不需要解析 JSON、不需要重试、不需要 Schema 验证。&lt;/p&gt;
&lt;p&gt;这不是又一个更小更快的 GPT。Jev 的架构、训练目标、采样策略全部不同。TypeSafe 称之为 &lt;strong&gt;System One 模型&lt;/strong&gt;，我认为这是 2026 年最有意思的 AI 发布之一。&lt;/p&gt;
&lt;p&gt;这篇文章从架构原理、训练方法、实际能力到基础设施影响，帮你全面拆解。&lt;/p&gt;
&lt;h2 id=&#34;1-什么是-system-one-模型&#34;&gt;1. 什么是 System One 模型&lt;/h2&gt;
&lt;p&gt;名字来自丹尼尔·卡尼曼的《思考，快与慢》：System 1 是快而直觉的，System 2 是慢而深思的。传统 LLM 是 System 2——逐 token 自回归生成文本。Jev 是 System 1——读一段状态（state），输出一个判断，&lt;strong&gt;单次并行前向传播完成&lt;/strong&gt;。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;LLM (System 2)&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Jev (System One)&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;训练信号&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;RLHF — 优化人类偏好&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;RLCD — 优化校准决策&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;输出&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;生成文本（字符串）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;带概率的 typed 结构化值&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;采样&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;顺序逐 token&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;并行&lt;/strong&gt;，所有输出一次完成&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;速度&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;3–329 秒（前沿模型）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;70–500 ms&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;成本&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.20–$10 / M 输入 tokens，输出约 5x 更贵&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$0.042 / M 输入 tokens，输出免费&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;类型安全&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;需解析+验证，仍可能幻觉格式&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;数学上保证类型正确&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;置信度&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;过度自信且不一致&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;校准的&lt;/strong&gt;：高置信度 = 高准确率&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;典型用例&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;聊天、代码生成、推理链&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;分类、路由、评分、验证&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;TypeSafe 在 workflow evals 上的数据是：&lt;strong&gt;比前沿 LLM 快 193.6 倍，便宜 444.6 倍&lt;/strong&gt;。他们发布的 Pareto 图显示 Jev 在结构化决策任务上处于完全独立的曲线——任何价位的 LLM 都无法在速度+准确率组合上匹配。&lt;/p&gt;
&lt;h2 id=&#34;2-架构核心并行采样&#34;&gt;2. 架构核心：并行采样&lt;/h2&gt;
&lt;p&gt;最根本的架构差异是&lt;strong&gt;并行采样&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;传统 LLM 逐 token 生成：token N+1 依赖 token 0..N。要输出一个结构化决策（比如从 5 个选项中分类并给出概率），模型必须先产出一长串描述答案的 token——每一个 token 都是潜在的幻觉点。&lt;/p&gt;
&lt;p&gt;Jev 反过来。给定一个 &lt;code&gt;state&lt;/code&gt; 和一组 &lt;code&gt;questions&lt;/code&gt;，它在&lt;strong&gt;单次前向传播中并行评估每个问题&lt;/strong&gt;。输出是固定形状的 typed 结构：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Noul&lt;/strong&gt;：一个 &lt;code&gt;[0, 1]&lt;/code&gt; 浮点数，代表「是」的概率&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Choice&lt;/strong&gt;：选中选项 + 所有选项的概率分布 + 置信度&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Score&lt;/strong&gt;：概率加权得分 + 每级概率 + 置信度&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因为输出形状在请求时就固定了，&lt;strong&gt;类型错误在数学上不可能发生&lt;/strong&gt;。不存在幻觉出畸形 JSON 键或错误闭合括号的 token。&lt;/p&gt;
&lt;p&gt;这对 agent 基础设施的意义巨大：你的代码不需要解析、验证、重试或 Schema 强制。&lt;code&gt;response.answers[&amp;quot;department&amp;quot;].choice&lt;/code&gt; 永远是 criteria 集合中的有效字符串。这是 AI 最接近「永远正确工作的函数调用」的一次。&lt;/p&gt;
&lt;h2 id=&#34;3-rlcd真正的训练秘密&#34;&gt;3. RLCD：真正的训练秘密&lt;/h2&gt;
&lt;p&gt;TypeSafe 最重要的创新可能不是架构，而是 &lt;strong&gt;RLCD（Reinforcement Learning for Calibrated Decisions）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;每个主要 LLM 实验室都用某种 RLHF：训练一个基于人类偏好的奖励模型，然后最大化这个奖励。创始人 Diogo Almeida 说得直白：「生成人类标注者更喜欢的文本」对自动化来说是&lt;strong&gt;错误的优化目标&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;RLVR（Reinforcement Learning with Verifiable Rewards）用程序化可验证的奖励信号部分解决了数学和代码的问题。但大多数现实世界的判断任务不适合这种形状——结果就是「尖峰智能」：在可验证 Benchmark 上表现好，在细微决策上不稳定。&lt;/p&gt;
&lt;p&gt;RLCD 优化的是&lt;strong&gt;校准度（calibration）&lt;/strong&gt;：模型输出的概率应该匹配真实结果频率。当 Jev 说一个工单有 85% 概率属于「技术」类别时，在所有这样的判断中，大约 85% 应该确实是技术类。校准曲线（ECE、可靠性图）直接衡量这个指标，RLCD 直接优化它。&lt;/p&gt;
&lt;p&gt;这和「让模型产出一条推理链然后希望结论正确」有本质区别。Jev 不推理——它&lt;strong&gt;判断&lt;/strong&gt;。训练数据是 TypeSafe 自己合成的（他们自称为「主要是数据研究实验室」），RLCD 过程在 System One 任务上迭代改进校准度。&lt;/p&gt;
&lt;h2 id=&#34;4-三个原语noul-choice-score&#34;&gt;4. 三个原语：Noul, Choice, Score&lt;/h2&gt;
&lt;p&gt;TypeSafe 恰好暴露三种问题类型，每种对应一种基本的决策形状：&lt;/p&gt;
&lt;h3 id=&#34;noul是否型&#34;&gt;Noul（是否型）&lt;/h3&gt;
&lt;p&gt;最简单的原语。问一个二值问题，返回概率 &lt;code&gt;[0, 1]&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;用途：内容审核、护栏触发、相关性过滤、大规模二值分类。&lt;/p&gt;
&lt;h3 id=&#34;choicen-选一&#34;&gt;Choice（N 选一）&lt;/h3&gt;
&lt;p&gt;从最多 255 个候选中选一个，返回完整概率分布 + 置信度。&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-json&#34; data-lang=&#34;json&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;{
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;department&amp;#34;&lt;/span&gt;: {
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;type&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;choice&amp;#34;&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;choice&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;technical&amp;#34;&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;confidence&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.78&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;probabilities&amp;#34;&lt;/span&gt;: {
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;      &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;technical&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.85&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;      &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;sales&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.0&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;      &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;billing&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.15&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    }
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  }
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;}
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;用途：意图路由、工单分类、模型选择、链接选择（Wikiracing demo 每步从 ~100 个链接中选）。&lt;/p&gt;
&lt;h3 id=&#34;score评分型&#34;&gt;Score（评分型）&lt;/h3&gt;
&lt;p&gt;在一组有序级别（2–10 级）上返回概率加权连续分数。&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-json&#34; data-lang=&#34;json&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;{
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;frustration&amp;#34;&lt;/span&gt;: {
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;type&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;score&amp;#34;&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;score&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;1.0&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;confidence&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;1.0&lt;/span&gt;,
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;probabilities&amp;#34;&lt;/span&gt;: { &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;0&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.0&lt;/span&gt;, &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;1&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;1.0&lt;/span&gt;, &lt;span style=&#34;color:#f92672&#34;&gt;&amp;#34;2&amp;#34;&lt;/span&gt;: &lt;span style=&#34;color:#ae81ff&#34;&gt;0.0&lt;/span&gt; }
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  }
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;}
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;用途：情感评分、质量评级、严重程度评估、复合评分（多个原子分数后在代码中组合）。&lt;/p&gt;
&lt;h2 id=&#34;5-置信度契约&#34;&gt;5. 置信度契约&lt;/h2&gt;
&lt;p&gt;Confidence 是 Jev 最被低估的杀手特性。&lt;/p&gt;
&lt;p&gt;Choice 答案不仅返回选了什么，还返回&lt;strong&gt;模型对这个选择有多确定&lt;/strong&gt;。置信度从概率分布计算：0.0（均匀分布——模型完全没把握）到 1.0（所有概率质量集中在一个选项）。&lt;/p&gt;
&lt;p&gt;这开启了一种 TypeSafe 称为 &lt;strong&gt;confidence-gated routing&lt;/strong&gt; 的模式：你的代码检查 &lt;code&gt;if answer.confidence &amp;gt; 0.8: 自动处理; else: 升级到人类或昂贵 LLM&lt;/code&gt;。不需要 Prompt 工程。不需要「你确定吗？」重试。模型在不确定时就告诉你。&lt;/p&gt;
&lt;p&gt;对 agent 基础设施来说，这是变革性的。当前的 agent 循环浪费大量计算在确定性的重试逻辑、确认 Prompt 和解析重试周期上。置信度门控架构在推理层面消除了大部分这种开销。&lt;/p&gt;
&lt;h2 id=&#34;6-两个-demodoom-和-wikiracing&#34;&gt;6. 两个 Demo：Doom 和 Wikiracing&lt;/h2&gt;
&lt;h3 id=&#34;doom10-次秒的实时决策&#34;&gt;Doom：10 次/秒的实时决策&lt;/h3&gt;
&lt;p&gt;Jev 通过评估游戏状态（敌人位置、血量、弹药、附近道具）来玩 Doom，以约 10 次查询/秒的速度选择动作。成本：约 &lt;strong&gt;$7/小时&lt;/strong&gt;。模型不在像素上运行——游戏状态被预解析为结构化文本——但延迟预算符合实时游戏要求。&lt;/p&gt;
&lt;p&gt;核心洞察：没有 LLM 能以商品化定价维持每秒 10 次结构化决策。这不仅是速度和成本问题，更是&lt;strong&gt;架构问题&lt;/strong&gt;——Jev 的并行评估让它在同一前向传播中处理多个决策，而 LLM 必须为每个动作生成一串 token。&lt;/p&gt;
&lt;h3 id=&#34;wikiracing无需解析的路由&#34;&gt;Wikiracing：无需解析的路由&lt;/h3&gt;
&lt;p&gt;从一篇 Wikipedia 文章出发，只用超链接导航到目标页面。每一步需要从数百个链接中选一个。Jev 评估每个链接的相关性并选一个。&lt;/p&gt;
&lt;p&gt;关键洞察：&lt;strong&gt;Jev 永远不会幻觉出不存在的链接&lt;/strong&gt;——这是 LLM 在高基数选择中常见的失败模式。利用 Choice 的 255 选项限制和更大候选集的 2 阶段评分，模型始终用更少的步数到达目标。&lt;/p&gt;
&lt;h2 id=&#34;7-已知缺陷jev-不能做什么&#34;&gt;7. 已知缺陷：Jev 不能做什么&lt;/h2&gt;
&lt;p&gt;TypeSafe 发布了一份相当坦诚的 &lt;strong&gt;「jaggedness」文档&lt;/strong&gt;。以下是真实限制：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;字面阅读&lt;/strong&gt;：Jev 回答你写的问题，不是你想问的。否定、隐含条件、作用域词都按字面理解。如果指令说「客户既生气又要求退款」而只有一个条件满足，Jev 可能基于部分重叠回答。&lt;strong&gt;规避&lt;/strong&gt;：分解为独立问题。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;不能数学和计数&lt;/strong&gt;：Jev 不能可靠计数。在 8 个项目的列表中问「几个是水果」会失败。&lt;strong&gt;规避&lt;/strong&gt;：每个项目一个 Noul，在代码中求和。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;不能比较日期和时间&lt;/strong&gt;：日期被视为文本，不是有序量。混合格式和时区边界特别不稳定。&lt;strong&gt;规避&lt;/strong&gt;：用 Choice 提取组件，在代码中比较。TypeSafe 提供了一个日期提取 cookbook。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;不支持间接推理&lt;/strong&gt;：双重否定或属性之属性会降低准确率。&lt;strong&gt;规避&lt;/strong&gt;：写最直接的问题。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;对大状态敏感&lt;/strong&gt;：准确率随着与决策无关的内容增多而下降。&lt;strong&gt;规避&lt;/strong&gt;：代码中先检索和过滤相关字段。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;不处理图像&lt;/strong&gt;：目前仅文本输入。Doom demo 将游戏状态预解析为结构化文本。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;语言偏差&lt;/strong&gt;：英语是主要训练语言，准确率最好。中日韩及其他语言「效果不那么好」。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这些不是致命伤——它们是&lt;strong&gt;不同范式的边界&lt;/strong&gt;。LLM 在这些方面也会失败，但失败的信号被流畅的文本掩盖了。Jev 的失败是透明的（低置信度、错误概率），因而更容易管理。&lt;/p&gt;
&lt;h2 id=&#34;8-对-agent-基础设施的影响&#34;&gt;8. 对 Agent 基础设施的影响&lt;/h2&gt;
&lt;p&gt;对于正在构建 agent 基础设施的人（包括 MCPZERO 和 NanoRuntime 的我们），Jev 改变了几个关键子系统的计算：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;路由层&lt;/strong&gt;：不再用单个 LLM 调用来决定意图。部署 Jev 作为预路由器——70–500ms、$0.042/Mtok、零解析开销、置信度门控升级到更强模型。这是我所见过最干净的「分类器 → 专家」架构。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;护栏&lt;/strong&gt;：Jev 比现有护栏模型更快更便宜。每个检查一个 Noul 问题（检测到劫持？泄露了 PII？违反策略？）在同一调用中运行，增加可忽略的延迟。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;验证&lt;/strong&gt;：用 Jev 评分任何其他 LLM 的输出。「这个答案引用了证据吗？评分 0–2。」「这个推理链逻辑一致吗？Noul。」以生成式调用 1/400 的成本，你可以验证生产中的每个 LLM 输出。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Agent 行为 Map-Reduce&lt;/strong&gt;：100 倍更便宜意味着你可以对 agent 会话的每一步进行分类、评分和特征提取——构建支持类似 ClawGuard 的可观测性和安全工具所需的行为数据集。&lt;/p&gt;
&lt;h2 id=&#34;9-更大的图景jevons-paradox&#34;&gt;9. 更大的图景：Jevons Paradox&lt;/h2&gt;
&lt;p&gt;TypeSafe 将模型命名为 Jev 是为了纪念 &lt;strong&gt;William Stanley Jevons&lt;/strong&gt;——他观察到煤的使用效率提高导致了&lt;strong&gt;更多的煤消费&lt;/strong&gt;，而不是更少——因为更便宜的能源解锁了新用例。&lt;strong&gt;Jevons Paradox&lt;/strong&gt; 是团队明确的赌注：当 AI 判断便宜 400 倍时，软件自动化的决策数量会&lt;strong&gt;爆发式增长&lt;/strong&gt;，而不是收缩。&lt;/p&gt;
&lt;p&gt;如果这个假设成立，未来不是一个巨大的聊天模型运行一切。它是一个分层架构：Jev 类模型在边缘做快速、廉价、校准的决策；更强的 LLM 保留给深度推理、创意生成和人类交互；中间的代码控制流程。&lt;/p&gt;
&lt;p&gt;这是一个值得为之构建的未来。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;strong&gt;关于作者&lt;/strong&gt;：万戈（Chengqi），AI Infra 工程师，前华为/万翼，现构建 MCPZERO（Agent 工具协议）、ClawGuard（Agent 行为安全）和 NanoRuntime（轻量级 Agent Runtime）。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
