<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>价格战 on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/%E4%BB%B7%E6%A0%BC%E6%88%98/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Thu, 24 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/%E4%BB%B7%E6%A0%BC%E6%88%98/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Claude Opus 5.5 发布！同天 OpenAI 发 Luna/Sol——AI 模型竞争进入「能力 x 成本 x 安全」三维时代！</title>
        <link>https://www.yesmiracle.net/post/20260924-claude-opus-5-5-launch/</link>
        <pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260924-claude-opus-5-5-launch/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260924-claude-opus-5-5-launch/cover.svg" alt="Featured image of post Claude Opus 5.5 发布！同天 OpenAI 发 Luna/Sol——AI 模型竞争进入「能力 x 成本 x 安全」三维时代！" /&gt;&lt;p&gt;如果你在 9 月 22 日打开 AI 新闻，会看到一场奇景：&lt;strong&gt;Anthropic 和 OpenAI 在同一天发布了新模型，但走的是两条完全不同的路。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Anthropic 拿出了 &lt;strong&gt;Claude Opus 5.5&lt;/strong&gt;——性能对标自家旗舰 Fable 5.1，但定价比 Opus 5 便宜 40%，缓存价格更是直降 60%。瞄准的是「跑一整天的长任务 Agent」。&lt;/p&gt;
&lt;p&gt;OpenAI 则亮出了 &lt;strong&gt;GPT-6 Luna 和 GPT-6 Sol&lt;/strong&gt;——不是新旗舰，而是 Astra 的能力下放版。Luna 的输入价格只要 &lt;strong&gt;$0.10/M token&lt;/strong&gt;，比一碗面还便宜。&lt;/p&gt;
&lt;p&gt;这不是巧合。这是 AI 模型竞争从「谁更强」进入「谁更值」的信号。&lt;/p&gt;
&lt;h2 id=&#34;claude-opus-55第一个-55-家族成员的底气&#34;&gt;Claude Opus 5.5：第一个 5.5 家族成员的底气&lt;/h2&gt;
&lt;p&gt;Opus 5.5 最大的亮点不是某个单项突破，而是&lt;strong&gt;全面均衡&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;从 Anthropic 官方基准测试来看，Opus 5.5 在 agentic coding 赛道表现亮眼：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;评测&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Opus 5.5&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Fable 5.1&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Opus 5&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;GPT-6 Astra&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Terminal-Bench 4.0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;66.4%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;55.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;52.3%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;57.9%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;FrontierCode v1.1 (Main)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;54.4%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;50.3%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;48.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;53.3%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;CursorBench 4.0&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;57.8%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;51.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;46.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;OSWorld 2.0 (Computer Use)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;81.8%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;80.7%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;74.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;AutomationBench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;40.0%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;31.4%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;26.9%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;41.4%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Humanity&amp;rsquo;s Last Exam&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;67.7%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;65.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;63.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;57.2%&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;在 Terminal-Bench 4.0 上，Opus 5.5 以 &lt;strong&gt;66.4%&lt;/strong&gt; 大幅领先 GPT-6 Astra 的 57.9% 和自家 Fable 5.1 的 55.8%。FrontierCode 上同样以 54.4% 领先 GPT-6 Astra 的 53.3%。&lt;/p&gt;
&lt;p&gt;更有意思的是&lt;strong&gt;实际场景&lt;/strong&gt;：一位早期测试者让 Opus 5.5 审计并修复一个 &lt;strong&gt;20 万行代码库&lt;/strong&gt;——&amp;lt;3 小时完成。Opus 5 需要 20+ 小时，且多耗 2.5 倍的 token。另一位测试者把六个仓库的工程任务扔给 Opus 5.5「无人值守跑过夜」——它在 18 小时内定义了服务间的通信方式，且代码注释「简短有用而非长篇大论」。&lt;/p&gt;
&lt;h3 id=&#34;定价策略悄悄打了一场聪明的价格战&#34;&gt;定价策略：悄悄打了一场聪明的价格战&lt;/h3&gt;
&lt;p&gt;Opus 5.5 的定价策略很有意思：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;项目&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Opus 5.5&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Opus 5&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;降幅&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;输入 ($/M token)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$4.00&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$5.00&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;↓20%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输出 ($/M token)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$20.00&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$25.00&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;↓20%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;缓存 ($/M token)&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.20&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$0.50&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;↓60%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;典型工作负载成本&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;↓40%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;表面看只是降价 20%，但注意缓存价格——&lt;strong&gt;$0.20/M token，降了 60%&lt;/strong&gt;。对于 Agent 编程和知识工作这类长上下文、多轮对话场景，缓存读取占了大部分成本。这是 Opus 5.5 的核心定价技巧：标价降 20%，但实际账单降 40%。&lt;/p&gt;
&lt;p&gt;同时输出速度比 Opus 5 快了 &lt;strong&gt;30%+&lt;/strong&gt;，Pro/Max/Team/Enterprise 计划的 5 小时用量限额也同步提升。&lt;/p&gt;
&lt;h3 id=&#34;安全升级最好的对齐测试成绩&#34;&gt;安全升级：最好的对齐测试成绩&lt;/h3&gt;
&lt;p&gt;Opus 5.5 是 Anthropic 首个在「呼吁放缓前沿模型发展」之后发布的模型。它在自动行为审计中取得了&lt;strong&gt;史上最好成绩&lt;/strong&gt;——比之前任何模型都更不容易越界、更不容易采取不可逆行动、对 prompt injection 的抵抗力也超过 Opus 5。&lt;/p&gt;
&lt;p&gt;Anthropic 还扩展了对齐测试覆盖范围，纳入了超长任务、不可能任务和真实事件模拟。因为 Opus 5.5 在生物学和网络安全能力上已接近 Claude Mythos 5.1，Anthropic 部署了与 Fable 5.1 同级别的安全防护——包括生命科学验证计划和网络安全验证计划来管控高风险使用。&lt;/p&gt;
&lt;h2 id=&#34;同一天openai-出了什么牌&#34;&gt;同一天，OpenAI 出了什么牌？&lt;/h2&gt;
&lt;p&gt;同一天，OpenAI 也发布了 &lt;strong&gt;GPT-6 Luna 和 GPT-6 Sol&lt;/strong&gt;——这是 Astra 发布后的 GPT-6 家族补齐。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;GPT-6 Luna&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;GPT-6 Sol&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;GPT-6 Astra&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;输入价格&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$0.10/M&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$2.00/M&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;旗舰定价&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输出价格&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$0.50/M&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;$10.00/M&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;旗舰定价&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;上下文&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1.05M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1.05M&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1M&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;定位&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;高吞吐、成本敏感&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;复杂编码、Agent 工作负载&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;全能力旗舰&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;降价幅度&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;vs GPT-5.6 Luna &lt;strong&gt;↓50%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;vs GPT-5.6 Sol &lt;strong&gt;↓50%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Luna 的 &lt;strong&gt;$0.10/M&lt;/strong&gt; 输入价格几乎把 AI 调用成本压到了地板——这对大批量处理任务、企业级自动化来说是巨大的吸引力。Sol 则在复杂编码和 Agent 工作负载上与 Opus 5.5 正面对抗。&lt;/p&gt;
&lt;p&gt;根据第三方分析，在 FrontierCode 上 Opus 5.5 得分 51.4%（单任务成本 $2.25），Sol 得分 48.4%（单任务成本 $1.37）。在 AutomationBench 上 Opus 5.5 得分 34.4%（$0.86/任务），Sol 得分 33.2%（$0.27/任务）。&lt;strong&gt;Opus 5.5 性能略高，但 Sol 成本显著更低。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;OpenAI 还改进了 prompt caching，声称缓存命中率默认更高，「帮 Agent 复用更多上下文、响应更快、缓存输入读取享 90% 折扣」。&lt;/p&gt;
&lt;h2 id=&#34;两种策略的分野&#34;&gt;两种策略的分野&lt;/h2&gt;
&lt;p&gt;把同一天的两场发布放在一起看，差异非常清晰：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Anthropic 的策略&lt;/strong&gt;：推最强的 Agent 模型，在顶级性能上不留余力地领先。降价 40% 是为了让更多企业用得起——但定位依然是「Premium Agent Compute」。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;OpenAI 的策略&lt;/strong&gt;：用 Luna 和 Sol 把入口价格打穿地板。Luna 的 $0.10/M 是为了让&lt;strong&gt;任何开发者毫无心理负担地调用 AI&lt;/strong&gt;。Sol 的存在是为了证明「便宜不一定差」——性能接近 Opus 5.5 但成本只有一半。&lt;/p&gt;
&lt;p&gt;这不是单纯的「谁赢谁输」。这是两家公司对 AI 市场未来形态的不同判断：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Anthropic&lt;/strong&gt; 认为 Agent 是下一个计算范式——企业愿意为真正能自动化复杂工作的 Agent 付高价。所以押注长任务一致性、安全可控、代码生成质量。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;OpenAI&lt;/strong&gt; 认为 scale 会继续吃——成本降低带来的需求弹性远大于性能提升。所以把能力下放、让 Agent 变得像水电一样便宜。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;
&lt;p&gt;这场同天发布让我想起一个历史瞬间：&lt;strong&gt;2015 年 AWS 推出 Lambda 的同时，Google 发布了 TensorFlow。&lt;/strong&gt; 一个在降低基础设施成本，一个在提升模型能力天花板——两条看似平行的线，最终在 AI 时代交汇。&lt;/p&gt;
&lt;p&gt;今天的情况类似。Opus 5.5 告诉我们，模型能力还在快速提升——Terminal-Bench 66.4%、OSWorld 81.8%、20 万行代码 &amp;lt;3 小时，这些数字一年前还不可想象。Luna 和 Sol 告诉我们，成本也在快速下降——$0.10/M 的推理价格正在让「让 AI 跑每一个决策」变成现实。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;能力提升 × 成本下降，才是真正的拐点。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;AI 模型竞争已不再是单一维度的竞赛。&lt;strong&gt;能力、成本、安全&lt;/strong&gt;——三维缺一不可。Opus 5.5 在安全对齐上拿了史上最好成绩，Luna 在成本上打穿地板，Sol 在能力-成本平衡点上找到最佳位置。每个维度都在被用户用「买不买得起、跑不跑得稳、敢不敢用」投票。&lt;/p&gt;
&lt;p&gt;未来的赢家，不会是某一个维度最强的模型，而是&lt;strong&gt;三个维度均衡最优&lt;/strong&gt;的那一个。&lt;/p&gt;
&lt;p&gt;如果你已经在跑 Agent 工作负载，Opus 5.5 值得立即试。如果你在做大批量高吞吐任务，Luna 可能是你没试过的省钱方案。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;延伸阅读：&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260922-grok-47-launch-benchmark-analysis/&#34; &gt;《Grok 4.7 发布：同价但翻倍！Terminal-Bench 暴涨 87%》&lt;/a&gt; — 同周的另一场模型大战 / &lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260920-qwen3-8-omni-flash-release/&#34; &gt;《Qwen3.8-Omni-Flash 横空出世！》&lt;/a&gt; — 开源模型的价格冲击&lt;/p&gt;&lt;/blockquote&gt;
</description>
        </item>
        
    </channel>
</rss>
