Google DeepMind 发布旗舰模型 Gemini 4 Argon,定位下一代前沿智能,但目前尚未公开可用。
Gemini 4 Argon 在真实世界的软件工程、企业知识工作(如法律和金融)以及网络安全防御领域的复杂工作流中实现了前沿性能。
Google DeepMind 高级副总裁兼 Google 首席 AI 架构师
Gemini 4 Argon 将先进的推理能力带入复杂的、长期的专业任务中。
该模型拥有行业领先的 100 万 token 上下文窗口,用于深度、多步骤的问题解决。
它在编程、金融研究、法律起草和自主网络安全漏洞修复方面表现出色。
Argon 目前正在通过 Fairwind 计划向可信赖的网络防御者推出。
Google 优先考虑安全性和严格测试,然后再向公众广泛发布。
今天,我们宣布推出新的前沿模型 Gemini 4 Argon,它正在通过我们的 Fairwind 计划向一批可信赖的网络防御者推出。Argon 专为在复杂的长期工作流中维持深度推理而构建,正在从根本上改变我们在 Google 的工作和构建方式。它在真实世界的软件工程、企业知识工作(如法律和金融)以及网络安全防御领域的复杂工作流中实现了前沿性能。
在这一级别安全地发布前沿能力需要分阶段方法。我们正在积极参与美国政府关于发布前模型访问的自愿流程,同时逐步扩大访问范围。我们将继续收集早期测试者的反馈,并在将 Argon 尽快提供给开发者、企业和消费者之前迭代护栏。
Argon 将以入门价格推出,每 100 万输入 token 2 美元,每 100 万输出 token 10 美元,缓存的输入 token 价格为输入 token 价格的 5 折。
改变我们在 Google 的工作和构建方式
Gemini 4 Argon 已经在为我们的内部工作流提供支持,数千名 Googler 强调了模型在专业编程任务、更深入的研究和质量写作方面的优势。它正在帮助团队更快地构建并突破工程生产力的边界,加速突破:
量子算法优化:Argon 正在帮助我们的量子计算研究人员优化子程序的时空资源(qubits × gates),这些子程序是重要应用的瓶颈。在一个例子中,它在几分钟内就以 40% 的优势超越了已发布的基准。
内存效率:一个 Argon 智能体团队分析了全舰队性能分析遥测数据,自主识别并应用了跨 Google 数据中心的内存优化,一旦部署将释放超过 300 TiB 的内存,预计总节省量为 500 TiB 到 1 PiB。
大规模代码库迁移和优化:Argon 智能体正在跨 Google 迁移 C/C++ 代码库到 Rust——从核心库(如 re2、libgav1)的数万行扩展到 Fuchsia Zircon 内核的 80 万行以上。鉴于这些系统的关键性,此类大规模重写正在接受严格的自动化和手动审计、仿真测试和审查,然后才会推广到生产环境。对于 libgav1(Google 用于视频解码的开源软件),Argon 智能体采用了一个现有的 Rust 移植版本,通过多轮基于配置的实验研究编译器输出,生成了安全的 Rust 代码以实现自动向量化,最终产生了内存安全的视频解码器,运行速度比 Rust 移植版本快 2.7 倍,视频输出完全相同,更接近优化后的 C++。
在最复杂的问题上更努力地工作
为了支持 Gemini 4 Argon 在更长、更复杂的用例中的能力,我们将模型的输出 token 限制大幅扩展到行业领先的 100 万 token,而此前为 64K token。当模型有足够的空间进行深度思考并在一个轨迹中生成数十万 token 时,它为一次性解决难题增添了新的推理深度。
跨领域支持编码和企业工作流
Gemini 4 Argon 在编码、推理和多模态方面的能力,以及其维持长时间、多步骤任务的能力,使其能够在一系列企业工作流中表现出色。
Google 工程师一直在将 Argon 用于日常任务,从日常调试到大规模代码库迁移和算法设计。它在 DeepSWE v1.1(77.9%)上创下了新纪录,该基准衡量模型在真实世界长期软件工程任务中的表现。
除了编码,Argon 在 Vals Index 上领先,该指标衡量经济影响,涵盖金融、编程、法律和税务工作,每个行业按其对美国 GDP 的贡献加权。我们在其他领域特定评估中也看到了类似的领先表现,如 Vals Finance Agent v2(多步骤金融研究)和 Harvey's Legal Agent Benchmark(法律研究和起草)。在 AutomationBench(Zapier 衡量核心业务功能端到端执行的基准)上,Argon 以 51.3% 的分数排名第一。
当知识工作需要视觉理解时,Argon 也具有独特的优势。它能够进行专业图表分析、从长视频中识别细节,并基于一系列文档采取行动。例如,在衡量长视频理解的 LVBench 上,Argon 以 91.7% 的分数名列前茅。
在防御性网络安全方面领先
为了更好地为网络防御者配备应对新时代网络攻击的能力,我们训练 Gemini 4 Argon 在网络安全防御方面具有高度能力。Argon 可以自主发现、验证和修补关键软件漏洞。对于可信赖的防御者和我们自己在 Google 的内部团队,我们将发布不带网络护栏的 Argon,以便他们能够利用其全部前沿级网络安全防御能力。
Wiz 已经通过其 Scan for Good 计划将 Argon 用于网络安全防御——该项目致力于通过发现和修复高风险暴露来保护关键公共基础设施。在其影响的早期演示中,该模型发现了一个关键漏洞,暴露了全球医院使用的医疗保健软件中的敏感个人信息,识别出了之前前沿模型遗漏的严重风险。
在 CWE-bench v1(评估模型修复安全漏洞能力)上,Argon 以 68% 的最高分并列第一,在 CWE-bench v0 上 3.8 Flash Cyber 的前沿性能基础上更进一步。
Gemini 4 Argon 在漏洞发现方面比 3.8 Flash Cyber 有了令人印象深刻的飞跃。例如:
在 Google 内部综合漏洞基准上,Argon 发现了跨 20 种编程语言的复杂代码库中的广泛暴露。
在 Wiz 内部黑盒渗透测试基准(测试模型在无源代码情况下分析实时网络系统的能力)上,Argon 在发现攻击面、识别漏洞以及生成概念验证证据以验证漏洞方面均优于 3.8 Flash Cyber。
在广泛发布前加强前沿护栏
在广泛推出 Gemini 4 Argon 之前,我们继续在四个主要领域加强关键的前沿护栏:
防止滥用:为了防止恶意行为者将 Argon 用于网络或化学、生物、放射性和核武器(CBRN)攻击,该模型被设计为拒绝有害请求,同时保留合法的双重用途科学研究,符合我们的前沿安全框架。我们正在加强此次发布护栏的稳健性,包括改进监控模型内部激活以发现滥用的技术。这些护栏通过手动和自动攻击方法相结合,由内部和外部红队进行了稳健性测试。
防止提示注入攻击:Argon 也是我们对间接提示注入最具韧性的模型,间接提示注入是指恶意指令或上下文被用来劫持模型行为。这些是复杂的攻击,需要持续警惕和多层防御。通过自动化红队对抗和对抗训练,Gemini 4 Argon 在 Gray Swan 的间接提示注入(IPI)基准上的提示注入稳健性方面领先。
监控错位:为了防止 Argon 越界尝试以超出用户意图的方式完成任务,我们正在部署错位缓解措施,监控 Argon 的思维链和行动,并在必要时停止执行。
我们使用类似的系统来监控我们的训练运行,并向专门的事件响应团队发送警报,同时谨慎地预防将发现反馈到训练中,以免冒塑造 Argon 推理以逃避监控的风险。我们强烈鼓励行业其他人在驾驭能力提升的关键时刻保持推理透明度,同时应对对齐风险,以便模型思维有助于识别和诊断错位。
强化系统:随着前沿模型变得越来越有能力,安全地测试它们需要能够跟上系统本身的安全环境。根据我们的智能体控制路线图,我们通过在高风险训练或评估开始之前隔离和密封沙盒环境来强化它们。我们致力于与合作伙伴分享这些智能体安全最佳实践,以提高整个生态系统的安全性。
我们构建 Gemini 4 Argon,使其在前沿级别的编程、知识工作、网络安全防御和创意写作方面具备能力,成为开发者和专业人士及企业在应对最困难问题时的合作伙伴。我们感谢首批网络防御者和可信赖测试者的贡献,他们的真实世界评估和反馈将帮助我们在向开发者、企业和消费者发布之前加强系统,发布将从付费 API 客户和 Google AI Ultra 订阅者开始。