Google DeepMind 发布 Gemini 4 Argon,百万级输出 Token,主要基准测试超越 GPT-6 Astra 和 Claude Opus 5.5,初期仅向「受信任网安人员」开放。
Google DeepMind 刚刚发布了 Gemini 4 Argon,这是一款新的前沿模型,也是 Gemini 4 系列的首个模型。它面向长周期软件工程、企业知识工作(法律和金融领域)以及网络安全防御。最核心的技术变化是输出长度——Argon 能在单次响应中生成最多 100 万 token,而此前 Gemini 模型的输出上限为 64K。
Google DeepMind 将 Argon 描述为面向复杂工作流构建的模型,涵盖编码、企业知识工作和网络安全防御。
Google 采取了分阶段推进策略,正在参与美国政府自愿性的发布前模型访问流程,将收集早期测试者的反馈,并在更广泛发布前迭代护栏机制。
定价已公开。Argon 初始定价为每 100 万输入 token 2 美元、每 100 万输出 token 10 美元。缓存输入 token 享受 95% 折扣,折合每 100 万仅 0.10 美元。初始期结束后,定价将调整为输入 4 美元、输出 20 美元。Logan Kilpatrick 确认了初始的 2 美元输入、10 美元输出定价。
当前前沿 API 的单次响应上限远低于此。Claude Opus 5.5、Claude Fable 5.1 和 GPT-6 Astra 均允许 12.8 万输出 token。
Google 团队表示,Argon 能够深入思考并在单个推理轨迹中生成数十万 token。对于开发者而言,这意味着可以进行大规模重构或撰写长篇报告,而无需跨多个轮次拆分工作。不过成本是真实存在的——完整输出 100 万 token 在初始定价下需花费 10 美元,初始期结束后需 20 美元。
Google 尚未披露 Argon 的输入上下文窗口大小。
Google 将 Argon 与 GPT-6 Astra、Claude Opus 5.5 和 Claude Fable 5.1 进行了对比。Argon 在 18 项基准测试中直接领先 12 项,另有 1 项并列第一。
DeepSWE v1.1(长周期软件工程):77.9%,刷新最高纪录。Opus 5.5 得分为 74.2%,GPT-6 Astra 为 74.1%。
Vals Index(金融、编码、法律和税务领域的经济影响):68.9%,排名第一。
AutomationBench(Zapier,端到端业务执行):51.3%,排名第一。Opus 5.5 得分为 42.5%。
Harvey Legal Agent Benchmark:19.6%,而 GPT-6 Astra 为 5.4%。
LVBench(长视频理解):91.7%,刷新最高纪录。
FrontierSWE v2:55.0%,落后于 GPT-6 Astra 的 65.5%。
Terminal-Bench 4.0:57.4%,落后于 Claude Opus 5.5 的 66.4%。
OSWorld-2.0(计算机使用):69.2%,落后于 GPT-6 Astra 的 72.6%。
Artificial Analysis 报告称,Argon 在其 Intelligence Index 上与 GPT-6 Astra 持平,而按折扣价格计算的单任务成本仅为 GPT-6 Astra 的 60%。
Google 训练 Argon 能够自主发现、验证并修补关键软件漏洞。可信防御者和 Google 内部团队可以在没有网络护栏的情况下使用它。
在 CWE-bench v1(测试漏洞修复能力)上,Argon 以 68% 并列第一。该排行榜上的竞品模型均运行在其各自的 agent 框架内。
Wiz 已通过其 Scan for Good 计划使用 Argon。该模型在某款全球医院使用的医疗软件中发现了一个关键漏洞。Google 表示此前的前沿模型均未能发现该漏洞。
在广泛发布前,Google 正在 4 个领域加强安全防护:
针对网络和 CBRN 风险的滥用防御,包括激活监控,纳入其前沿安全框架。
抵御间接 prompt 注入,Argon 在 Gray Swan 的 IPI 基准上处于领先。
对思维链和动作的不对齐监控,并具备停止执行的能力。
用于高风险训练和评估的密封隔离沙箱。
已有数千名 Google 员工使用 Argon。Google 分享了 4 项内部成果:
Argon agent 在数据中心应用了内存优化,释放了超过 300 TiB,预计可释放 500 TiB 到 1 PiB。
Agent 在 libgav1 Rust 移植项目中替换了 3.2 万行 SIMD 代码。解码器以相同输出运行,速度提升 2.7 倍。
Agent 正在将 C/C++ 代码库迁移到 Rust,Fuchsia Zircon 内核规模达 80 万行以上。
Argon 在数分钟内以 40% 的优势击败了已发布的量子算法基准。
| 功能 | Gemini 4 Argon | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| 开发商 | Google DeepMind | Anthropic | Anthropic | OpenAI |
| 可用性 | 仅 Fairwind 计划 | Claude API 及各云 | Claude API 及各云 | OpenAI API |
| 单次最大输出 | 100 万 token | 12.8 万 | 12.8 万 | 12.8 万 |
| 上下文窗口 | 未披露 | 100 万 | 100 万 | 105 万 |
| 输入/输出价格(每 100 万) | 初始 $2 / $10,后续 $4 / $20 | $4 / $20 | $10 / $50 | $10 / $50 |
| 缓存输入(每 100 万) | $0.10(初始) | $0.20 | $0.25 | $1.00 |
| 开放权重 | 否 | 否 | 否 | 否 |
| DeepSWE v1.1 | 77.9% | 74.2% | 67.4% | 74.1% |
| Vals Index | 68.9% | 67.0% | 65.8% | 63.1% |
| FrontierSWE v2 | 55.0% | 62.3% | 56.3% | 65.5% |
| Terminal-Bench 4.0 | 57.4% | 66.4% | 57.9% | 58.2% |
| CWE-bench v1 | 68%(并列) | 67% | 58% | 68%(并列) |
来源:Google、Anthropic Opus 定价、Anthropic Fable 5.1 文档、OpenAI GPT-6 Astra 文档、OpenRouter。基准分数来自 Google 发布的对比数据。GPT-6 Astra 价格为短上下文层级的定价。
Gemini 4 Argon 将输出上限从 64K 提升到 100 万 token。
在 DeepSWE v1.1(77.9%)和 Vals Index(68.9%)上处于领先。
在 FrontierSWE v2、Terminal-Bench 4.0 和 OSWorld-2.0 上落后于部分竞品。
初始定价 $2 / $10 仅为 Claude Opus 5.5 的一半。
目前仅向 Fairwind 网络防御者开放,尚无公开发布时间。