你盯着最复杂的长周期代码任务,一排排跑完,输出到第 63,000 个 token 突然截断——深吸一口气,打下一轮 prompt,从头再跑。
这个场景,所有用 Frontier 模型做 Agent 的工程师再熟悉不过了。64K 输出上限像一堵墙,把需要深度推理的长链条任务切得支离破碎。
昨天,Google DeepMind 直接用 1,000,000 个输出 token 把这堵墙推倒了。
《Claude Opus 5.5 发布!同天 OpenAI 发 Luna/Sol》
一句话定位
Gemini 4 Argon,旗舰 Pro 级,Gemini 4 代的首个模型。它在长期软件工程、企业知识工作(法律、金融)、网络防御三方面设置了新标杆。但有个不寻常的前提:这不是一个公开发布。它先只给 Fairwind 计划下「可信赖的网络防御者」使用——这是 Google 安全先行策略的极致体现。
距离上一代 Gemini 3 Pro(2025 年 11 月)已过去 10 个月——Google 在此期间跳过了 3.5 Pro,靠 Flash 系列撑场。现在,它用一个全新的元素命名体系回来了。
规格表:一页看清全貌
| 参数 | Gemini 4 Argon |
|---|---|
| 开发商 | Google DeepMind |
| 前代路径 | Gemini 3 Pro(2025.11)→ 跳过 3.5 Pro |
| 模型等级 | 旗舰 Pro / Frontier |
| 输出 Token 上限 | 1,000,000(16x 前代 64K) |
| 输入上下文窗口 | 1M-token 级 |
| 持续推理 | 单轮数百万 token 生成轨迹 |
| 输入推理路径 | 支持(Reasoning mode) |
| 输入模态 | 文本 + 图像 |
| 输出模态 | 文本 |
| 首批可用性 | Fairwind Program 独家 |
| 下批 | 付费 API + Google AI Ultra |
定价:告诉市场「我来竞争了」
Google 打了一张 introductory 牌:
| 模型 | 输入(/1M tokens) | 输出(/1M tokens) | 缓存 |
|---|---|---|---|
| Argon(引介价) | $2 | $10 | 95% 折扣($0.10) |
| Argon(标准价) | $4 | $20 | 同上 |
| Claude Opus 5.5 | $4 | $20 | 无公开 |
| Claude Fable 5.1 | $10 | $50 | 无公开 |
引介价直接把 Argon 放到了 Opus 5.5 的一半。Google 说这是「引介定价」——多久?没说。但这段窗口期内,Argon 是 $20/1M 输出质量的一半价。
另外,缓存 95% 折扣($0.10/1M 输入)是现阶段最激进的——如果你做大量系统 prompt 复用的 Agent,这直接决定成本模型。
1M 输出:不是噱头,是架构新范式
为什么 1M 输出是个大事?
因为长链条 Agent 的真正瓶颈从来不在输入,在输出。
一个需要推理数百个文件依赖的编码 Agent 会在一次 unrolling 过程中产生数百 K 的内部 Thought Chain——然后写完整的新模块代码又要几百 K。以前,你必须手动拆任务、分轮次对话、管理上下文连续性——每轮都有「忘记前一轮意图」的风险。
Koray Kavukcuoglu(Google DeepMind SVP)说得直白:
“当模型有足够的思考空间生成数百千 token 的单一轨迹时,它增加了推理深度,能一次性解决难题。”
16x 的输出空间意味着一个 Agent 可以:
- 摄入多文件依赖图 → 2. 做几百 K 的内部 chain-of-thought → 3. 合成新模块 → 4. 输出完整文件
全部在一个连续流里完成。不再有断点、不再有上下文丢失。
Benchmark 拆解:家底和短板一览
Google 发布了 Argon vs GPT-6 Astra vs Claude Fable 5.1 vs Claude Opus 5.5 的 19 个 Benchmark。我挑出最关键的 11 项,按能力域拆分:
🚀 领先领域(Argon 擅长的)
| 评测 | Argon | GPT-6 Astra | Opus 5.5 | Fable 5.1 |
|---|---|---|---|---|
| DeepSWE v1.1(长程编码) | 77.9% 🏆 | 74.1% | 74.2% | 67.4% |
| Vals Index(综合 GDP 影响) | 68.9% 🏆 | 63.1% | 67.0% | 65.8% |
| AutomationBench(业务流程执行) | 51.3% 🏆 | 41.4% | 42.5% | 31.4% |
| Harvey Legal Agent(法律研究与起草) | 19.6% 🏆 | 5.4% | 3.8% | 6.7% |
| Vals Finance v2(金融多步推理) | 65.4% | 53.5% | 58.6% | 58.9% |
| LVBench(长视频理解) | 91.7% 🏆 | 87.5% | 83.7% | 79.7% |
| GraphWalks 256k-1M(超长上下文路径查找) | 84.2% 🏆 | 71.8% | 66.8% | 65.0% |
最炸裂的数字是 Harvey Legal Agent——19.6%,是第二名 GPT-6 Astra(5.4%)的 3.6 倍。 这个差距不是几个百分点——是量级差。法律研究与起草是 Frontier 模型落地最有商业价值的场景之一,Google 在这里打了一场「跨代碾压」。
DeepSWE v1.1 的 77.9% 被 Google 称为「新 SOTA」。这个评测覆盖 113 个任务、91 个公开代码仓库、5 种语言,测的是真实世界的长生命周期软件工程,不是算法竞赛题。
⚡ 短板领域(Argon 落后的)
| 评测 | Argon | GPT-6 Astra | Opus 5.5 | Fable 5.1 |
|---|---|---|---|---|
| FrontierSWE v2(高级编码) | 55.0% | 65.5% 🏆 | 62.3% | 56.3% |
| Terminal-bench 4.0(终端操作) | 57.4% | 58.2% | 66.4% 🏆 | 57.9% |
| CWE-bench v1(漏洞修复) | 68% | 68% 🏆 | 67% | 58% |
在 FrontierSWE v2 上,GPT-6 Astra 领先 Argon 整整 10.5 个百分点。Terminal-bench 4.0 上,Opus 5.5 领先 9 个百分点。这印证了「综合能力强 ≠ 所有单项最强」——不同模型在代码任务的不同维度各有专长。
独立评测验证
Artificial Analysis 的 Intelligence Index(v4.3.2,包含 10 项评测综合)给 Argon 打了 53 分——与 GPT-6 Astra 同分,比 GPT-6.1 Sol(52 分)高 1 分。这也验证了 Argon 整体上「追平了 Frontier 一线」但没有超越。
安全先行:Fairwind 独家首发,为哪般?
最不寻常的策略是首发只给网络防御者。
Fairwind 是 Google 的「可信防御者轨道」,专门为保护关键基础设施的团队保留。首批用户包括:
- Wiz — 通过其 Scan for Good 项目使用 Argon 自动发现并修复高危漏洞
- Google 内部安全团队 — 用于漏洞发现、验证和补丁生成
- 美国政府伙伴 — 通过自愿的联邦预发布审查机制
关键细节:Google 称,对 Fairwind 可信防御者,会发布无网络防护栏(without cyber guardrails)版本,让它们用全部防御能力。
这意味着什么?世界级模型武装防御者,先于商业用户。这是 Google 在 Agent 安全攻防加速升级(同月已有 OpenAI Agent 自主攻破医疗机构、NVIDIA 发布安全平台)的背景下打的一张「安全牌」。但这张牌的背面是:开发者想用 Argon 做产品?还得等。
Google 内部已大规模使用
这不是一个「等别人测」的模型。Google 内部数千雇员已在用 Argon:
- 300+ TiB 内存回收:一组 Argon 代理分析 Google 数据中心全局 telemetry 数据,自主发现并应用内存优化——预计总节省 500 TiB 到 1 PiB。
- Rust 大规模迁移:Argon 正在将 C/C++ 代码库迁移到 Rust——re2、libgav1 等核心库,到 Fuchsia Zircon 内核(800K+ 行)。在 libgav1 解码器上,Argon 通过自主探索将 Rust 移植版的 SIMD 部分优化到编译器自动向量化,最终达到 2.7 倍加速。
- 量子算法优化:Argon 帮助量子计算团队优化了时间和空间资源约束的子程序,在几分钟内超过已发表 baseline 的 40%。
- 漏洞发现:在 Wiz 的黑箱渗透测试 Benchmark 上,Argon 的攻击面发现和 PoC 验证能力全面超过 3.8 Flash Cyber。
写在最后
Google 的 Gemini 4 Argon 不是这次发布里「全面领先」的模型——FrontierSWE 和 Terminal-bench 的短板真实存在。但这次发布的战略信号比任何 Benchmark 数字都重要:
Google 在关键的 2026 Q4 节点告诉市场——我回来了,逐项部署,不计成本。
1M 输出 Token 是架构层面的差异化——如果开发者真正开用,它可能改变 Agent 应用的设计范式(不拆任务才是常态)。Fairwind 首发策略是 Google 对「安全红利」的赌注:先武装防御者,再放开发者,从而在商业落地之前建立信任基线。
Introductory 定价是直接的市场下注——Half price vs Opus 5.5,等 Opus 5.5 和 Astra 的开发者们跑过来做成本对比。
但这里有一个问题留给每个正在选型的 Agent 工程师:如果你的 Agent 需要在 FrontierSWE 这类高级编码任务上领先,Astra 仍是霸主;如果你的 Agent 替代的是律师、分析师、金融研究者——Argon 可能是更好的选择。
不是有没有绝对的赢家——而是赢家因场景而异。