<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Fable 5.1 on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/fable-5.1/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Wed, 02 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/fable-5.1/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Claude Fable 5.1 横空出世！标价不变，便宜 45%，Opus 5 让位了！</title>
        <link>https://www.yesmiracle.net/post/20260902-claude-fable-51/</link>
        <pubDate>Wed, 02 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260902-claude-fable-51/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260902-claude-fable-51/cover.svg" alt="Featured image of post Claude Fable 5.1 横空出世！标价不变，便宜 45%，Opus 5 让位了！" /&gt;&lt;p&gt;如果你关注 AI 模型市场，昨天（9 月 1 日）是值得标记的一天——Anthropic 发布了 Claude Fable 5.1 和它的孪生兄弟 Claude Mythos 5.1。这是同一个人工智能引擎，分了两套安全护栏。&lt;/p&gt;
&lt;p&gt;但这次发布最反常的地方在于：&lt;strong&gt;标价不涨反降——实际上是没涨，但账单确实少了。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Fable 5.1 的 $10/$50 输入输出定价和 Fable 5 完全一样，API ID 也没变太多（claude-fable-5-1，Fable 5 是 claude-fable-5），但 Anthropic 在缓存读取上砍了一刀狠的：从 $1 降到 $0.25，降幅 75%。对于重度 Agent 工作负载，这意味着整体花费减少 25% 到 45%。&lt;/p&gt;
&lt;p&gt;华尔街的对冲基金已经开始行动了。Millennium 一位高级投资经理说，他们内部一个极其罕见的崩溃（百万分之一级别），工程师花了 &lt;strong&gt;四五年都没找到原因&lt;/strong&gt;，其他所有模型也都失败，Fable 5.1 第一次跑就定位了。这件事某种意义上比任何 Benchmark 排名更有说服力。&lt;/p&gt;
&lt;h3 id=&#34;benchmark全面碾压不留死角&#34;&gt;Benchmark：全面碾压，不留死角&lt;/h3&gt;
&lt;p&gt;先上这张表。Anthropic 官方发布时给出的七项基准测试，Fable 5.1 全部领先：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;Benchmark&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Fable 5.1&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Fable 5&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Opus 5&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;GPT-5.6 Sol&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Terminal-Bench-Science 0.1（Agent 科研）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;52.6&lt;/strong&gt; 🚀&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;24.7&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;29.0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;22.4&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Terminal-Bench 4.0（Agent 终端编码）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;55.8&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;42.0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;52.3&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;37.3&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;GDPval-AA v2（知识工作，Elo）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;1,853&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1,723&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1,824&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1,711&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;OSWorld 2.0（计算机使用，部分/严格）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;77.9 / 41.7&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;72.9 / 36.1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;75.4 / 39.6&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;未公布&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Humanity&amp;rsquo;s Last Exam（无工具/有工具）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;60.9 / 65.0&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;57.8 / 63.8&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;56.6 / 63.6&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;未公布&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;AutomationBench（业务流程）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;31.4&lt;/strong&gt; 🚀&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;17.1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26.9&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;19.6&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;CursorBench 3.2.0（Agent 编码）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;73.4&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;70.5&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;70.0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;67.2&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;两个值得单独看的数据：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Terminal-Bench-Science&lt;/strong&gt; 是差距最大的——52.6 vs 24.7，三倍不到的时间内直接把前代翻了一番。这不是渐进式改进，而是代际跳跃。对于一个用来做 Agent 科研任务的模型来说，这个数字意味着它真的可以在实验室里当半个研究员用。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;AutomationBench&lt;/strong&gt; 差不多也是翻倍：31.4 vs 17.1，比 Opus 5 也高出 4.5 分。Zapier 搭建的这个端到端业务工作流评测，对 AI Agent 的实用价值是直接信号。&lt;/p&gt;
&lt;p&gt;Cognition（Devin 背后的团队）的 CTO Walden Yan 说得很直接：「&lt;strong&gt;我们发布当天就把 Devin 里的 Opus 5 流量切到 Fable 5.1 了。&lt;/strong&gt; 测试下来它和 Fable 5 得分持平或更好，但每个任务的成本反而更低。有了新的缓存读取定价，Fable 级模型终于在我们这里真正经济能用了。」&lt;/p&gt;
&lt;h3 id=&#34;真正的赢家是-effort-曲线不只是峰值&#34;&gt;真正的赢家是 Effort 曲线，不只是峰值&lt;/h3&gt;
&lt;p&gt;上面的表格比较的是各家模型的最好成绩。但更精彩的故事藏在「付出 vs 回报」曲线里。&lt;/p&gt;
&lt;p&gt;Anthropic 的 Fable 5.1 在低（low）努力模式下，得分约 26%，每任务成本约 $11。对比 Fable 5 开到最大（max）努力模式才得 24.7%，每任务成本 $44。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Fable 5.1 的最低档，打翻了 Fable 5 的最高档，花费还只要四分之一。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;而且两根曲线从没碰在一起过：Fable 5.1 的 high 档（约 40%，$20）就超过了 Fable 5 全部档次，甚至比 Opus 5 的最高分还高；曲线继续爬升到 xhigh（约 49%）和 max（52.6%），而 Fable 5 早就平了。&lt;/p&gt;
&lt;p&gt;这意味着什么呢？如果你还在用路由策略把简单任务分配给小模型、难任务留给大模型，现在 Fable 5.1 的低档跑进这个比较范围了。Anthropic 的提示工程指南也直接说：在低努力下，「Fable 5.1 在单位成本上往往能和其他 Claude Opus 和 Sonnet 模型竞争，而且得分更高。」&lt;/p&gt;
&lt;p&gt;Every 的 CEO Dan Shipper 总结得更形象：「&lt;strong&gt;这是个友好的 Fable——Fable 级的智力、Opus 级的价格、Sonnet 的速度。&lt;/strong&gt; 我们测试下来大约是 Opus 5 的两倍速度，一半的 token 消耗。所以任何人如果把 Opus 当日常模型用，这绝对是个明显的升级。」&lt;/p&gt;
&lt;h3 id=&#34;三处破坏性变更你的代码可能需要修&#34;&gt;三处破坏性变更——你的代码可能需要修&lt;/h3&gt;
&lt;p&gt;这块是容易被忽略的部分。Fable 5.1 有&lt;strong&gt;三个破坏性 API 变更&lt;/strong&gt;，生产环境中如果没用过，第一个下午就会看到 400 报错：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;1. 强制工具调用（forced tool use）被禁了&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;以前 Fable 5 接受所有 &lt;code&gt;tool_choice&lt;/code&gt; 值，包括 &lt;code&gt;type: &amp;quot;any&amp;quot;&lt;/code&gt; 和 &lt;code&gt;type: &amp;quot;tool&amp;quot;, name: &amp;quot;...&amp;quot;&lt;/code&gt;。Fable 5.1 和 Mythos 5.1 会直接返回 400，原因是思考（thinking）始终启用，强制调用会跳过思考过程。修复方案：改成 &lt;code&gt;tool_choice: &amp;quot;auto&amp;quot;&lt;/code&gt; + &lt;code&gt;strict: true&lt;/code&gt; + 在指令中指定工具名称，或者用结构化输出（structured outputs）。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;2. 旧模型无法读取 Fable 5.1 的思考块&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;每个 thinking block 记录了由哪个模型生成，规则是单向的——Fable 5.1 能读旧模型（Opus 5、Fable 5、Mythos 5 及更早），但旧模型不能读 Fable 5.1 的。如果路由切换、客户端重试或兜底降级时遇到不匹配的 block，API 会静默丢弃，不收费，但目标模型会重算，成本上升、延迟增加。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;3. 编辑对话历史会让 thinking block 作废&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;每条 thinking block 只对当时的 system prompt、tools 数组和 message 历史有效。如果你代码中改了之前的任何内容，再发回带那块的请求会直接失败——message 校验不通过。不过这条只在 2026 年 8 月 31 日之后创建的新 API 账户上强制生效。Anthropic 明确说这是针对蒸馏（distillation）的防护：保留 Claude 的思考过程同时编辑上下文，是一种「公开的蒸馏技术」。&lt;/p&gt;
&lt;h3 id=&#34;mythos-51同引擎低护栏&#34;&gt;Mythos 5.1：同引擎，低护栏&lt;/h3&gt;
&lt;p&gt;跟着 Fable 5.1 一起发布的还有 &lt;strong&gt;Claude Mythos 5.1&lt;/strong&gt;，和 Fable 5.1 完全相同的权重，只是安全护栏更宽松。它只对经过审查的网络安全和生命科学组织开放，走 Anthropic 的「Project Glasswing」信任访问计划（Cyber Verification Program + Life Sciences Verification Program），目前只面向美国组织。&lt;/p&gt;
&lt;p&gt;最有意思的对比数据是：Mythos 5.1 在 Terminal-Bench 4.0 上拿了 &lt;strong&gt;60.9&lt;/strong&gt;，比 Fable 5.1 的 55.8 高了 5 分。Anthropic 坦诚地解释说：那 5 分「反映的是我们更粗糙的旧安全护栏介入的那些任务。」换句话说，安全护栏是有代价的——这是 AI 安全领域经常被低估的「护栏税」（safety tax）。&lt;/p&gt;
&lt;h3 id=&#34;定价对比cache-阅读就是新战场&#34;&gt;定价对比：Cache 阅读就是新战场&lt;/h3&gt;
&lt;p&gt;Fable 5.1 的定价结构最值得关注的变化不是标价，而是&lt;strong&gt;缓存读取价格&lt;/strong&gt;：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;项目&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Fable 5&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Fable 5.1&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;变化&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;输入 / M tokens&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$10&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$10&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;不变&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输出 / M tokens&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$50&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$50&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;不变&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;缓存读取 / M tokens&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$1.00&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$0.25&lt;/strong&gt; 🚀&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;↓ &lt;strong&gt;75%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;缓存写入（5分钟）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$12.50&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$12.50&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;不变&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;缓存写入（1小时）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$20&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$20&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;不变&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Batch 输入&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$5.00&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$5.00&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;不变&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Batch 输出&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$25.00&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$25.00&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;不变&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这一刀砍下去，Fable 5.1 的&lt;strong&gt;有效成本率&lt;/strong&gt;变了天。Fable 5 的缓存读取是输入的 10%（$1/$10），Fable 5.1 的缓存读取只有输入的 &lt;strong&gt;2.5%&lt;/strong&gt;（$0.25/$10）。这意味着长上下文 Agent 任务中，预填充（prefix）的重复读取几乎免费了。&lt;/p&gt;
&lt;p&gt;Anthropic 这次没有拿 Opus 5 的数据做比较，但我们从合作伙伴那里看到了选择逻辑：Opus 5 的缓存读取 $0.50 是 Fable 5.1 的 2 倍，且 Fable 5.1 在所有 Benchmark 上领先——Opus 5 唯一的优势是零数据留存（zero data retention）现在可用，而 Fable 5.1 要到今年秋季的 Enterprise Frontier Safeguards 落地后才能免除 30 天强制留存。&lt;/p&gt;
&lt;h3 id=&#34;opus-5-还活着吗&#34;&gt;Opus 5 还活着吗？&lt;/h3&gt;
&lt;p&gt;Opus 5 的处境有点尴尬。它输掉了所有七项 Benchmark，合作伙伴引用中几乎没有人选它。但 Anthropic 的官方提示仍然说：&lt;strong&gt;大多数工作负载从 Opus 5 开始&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;理由有三：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;价格便宜一半&lt;/strong&gt;：Opus 5 是 $5/$25，Fable 5.1 是 $10/$50。如果你的质量门槛 Opus 5 已经能过，Fable 5.1 就是花了双倍钱。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;零数据留存可用&lt;/strong&gt;：今天就有，Fable 5.1 强制 30 天，除非你拿到 Anthropic 的特批。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;API 表面更友好&lt;/strong&gt;：支持强制工具调用、可禁用思考、有 Batch 300K 扩展输出——每一条都是 Fable 5.1 的限制。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;所以短期内 Opus 5 不会消失。但方向很清楚了——质量在向 Fable 类模型汇聚，而 Opus 类的存在意义正在变窄。&lt;/p&gt;
&lt;h3 id=&#34;写在最后&#34;&gt;写在最后&lt;/h3&gt;
&lt;p&gt;Fable 5.1 的发布节奏很特别：&lt;strong&gt;标价不变，账单变少，性能更高。&lt;/strong&gt; 这不是一个典型的涨价式模型发布，而是一个成本效率发布。&lt;/p&gt;
&lt;p&gt;Anthropic 巧妙地绕开了一场价格战：别的公司在降标价，它们降缓存价格。这个战术的聪明之处在于——缓存价格不影响竞争对手直接用数字做比较，但对重度用户（Agent 开发者、企业、编码助手）来说，有效成本是实打实的 25-45% 降低。&lt;/p&gt;
&lt;p&gt;关于 Mythos 5.1 那 5 分的「安全护栏税」，我认为值得行业思考：如果你在构建需要最高 AI 能力的 Agent 系统，安全护栏的成本不只是 token 和延迟，还有真实的性能差距。这不是说安全不重要——而是说明它有多贵。&lt;/p&gt;
&lt;p&gt;最后，如果你跑的是 Fable 5 或 Opus 5 的生产管线，&lt;strong&gt;建议立刻做 migration 测试&lt;/strong&gt;：三个破坏性变更中，forced tool use 的禁令和 history editing 的 check 会直接影响你的代码。跑一轮 eval 确认兼容性，再把关键负载切过来——Cache $0.25 的利率窗口不会永远开着。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;📌 延伸阅读：如果你对模型路由选择感兴趣，不妨看看我们之前写的 &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260711-agent-interconnect-protocols/&#34; &gt;《Agent 互联！五大协议详解》&lt;/a&gt;，里面讨论了不同协议下的路由策略，和 Fable 5.1 的 Effort 曲线选择一脉相承。&lt;/p&gt;&lt;/blockquote&gt;
</description>
        </item>
        
    </channel>
</rss>
