早期测评显示 Gemini 4 Argon 性能优异,但 Google 以网络安全为由限制访问,目前仅有少数「受信任的网络防御者」可用。
我们很高兴你成为我们的读者。以后每个工作日(周一至周五),你都会收到 TNS 最优质的内容,让你随时掌握动态、保持领先。
请查收确认邮件,你可以在邮件中调整订阅偏好,甚至加入更多的订阅组。
欢迎在各大社交媒体平台关注 TNS。
欢迎在 LinkedIn 上关注 TNS。
在等待第一封 TNS 简报期间,你可以先看看最新的精选文章和热门报道。
周三,Google 发布了外界期待已久的旗舰模型 Gemini 4 Argon,看起来这波等待是值得的。
在大多数基准测试中,Gemini 4 Argon 击败了 OpenAI 和 Anthropic 的顶级模型,部分领先幅度相当大;不过在它落后的地方,差距最高可达 10 分。
Google 表示正在采取分阶段推进策略,"我们积极参与了美国政府关于模型预发布访问的自愿机制,同时逐步扩大访问范围。"
Gemini 4 Argon 在大多数基准测试中大幅领先 OpenAI 和 Anthropic 的顶级模型。
此次发布恰逢 Google CEO 桑达尔·皮查伊与唐纳德·特朗普总统会面后,联名签署了一项"自律"承诺。仅一天之后,Anthropic、Meta、Nvidia、OpenAI 和 SpaceX 也签署了这一"承诺"——不过该承诺似乎没有任何执行机制。
Google 表示,将在向 Fairwind 计划以外的用户开放之前,收集早期测试者的反馈并迭代 Argon 的安全护栏。一旦正式开放,付费 API 用户和 AI Ultra 订阅者将优先体验新模型,随后才会面向开发者、企业和普通消费者发布。
与它的 namesake(无聊、无味、惰性的氩气)不同,Gemini 4 Argon 很可能会引发不小的轰动。Google 于 5 月的 I/O 开发者大会上首次宣布了新款 Pro 模型(即 Gemini 3.5 Pro)的计划——Argon 本质上是它的替代品。原本计划 6 月发布这款新模型,但最终我们只等来了一系列 Flash 模型。
编程能力:一般。知识工作:优秀
在 Google 的基准测试中,涵盖多种任务类型,Argon 在与 Anthropic 的 Opus 5.5 和 Fable 5.1,以及 OpenAI 的 GPT-6 Astra 的对比中,在 18 项测试中的 13 项拿到第一(部分为并列)。
不过,Google 特别提及了 Argon 的编程能力,但结果喜忧参半。
Google 强调 Argon 在 DeepSWE v1.1 上取得了 77.9% 的成绩,创下新 SOTA;但在 FrontierSWE v2 和 Terminal-Bench 4.0 上,Argon 均排名末位,GPT-6 Astra 和 Opus 5.5 分别领先它 10.5 分和 9 分。它的另一个编程优势是在 Vibe Code Bench 上取得了 91.9%,但四款模型在该测试中的得分均超过 89%。
但 Argon 真正擅长的领域是知识工作。
Argon 在 Zapier 的 AutomationBench 上取得了 51.3%,领先 Opus 5.5 近 9 分;在 GraphWalks 测试(256K 到 1M token 的输入)中取得 84.2%,领先 GPT-6 Astra 超过 12 分。
它在 Harvey's Legal Agent Benchmark 上的 19.6% 是 Fable 5.1 的近三倍,不过这也意味着它只能完整完成约五分之一的任务。
在其他领域,Argon 的领先优势更为微弱。虽然它在 Vals Index、Vibe Code Bench、Agent's Last Exam、Chartography 以及较短的 GraphWalks 测试中领先,但这些领先通常不到 2 分。
在 CWE-bench v1(该报道中唯一的网络安全基准测试)中,Argon 与 GPT-6 Astra 和 xAI 的 Grok 4.7 以 68% 打平,Opus 5.5 落后 1 分。不过值得注意的是,OpenAI 和 Anthropic 的模型运行在他们各自的 agent 框架中(Codex 和 Claude Code),因此该排行榜衡量的是模型与其工具链的整体表现。
一如既往,基准测试从来不能说明全部,但看起来 Google 确实将这款模型打造得特别适合标准的办公室任务。
鉴于 DeepSWE 的亮眼成绩,开发者们肯定也会想要测试这款模型。
100 万输出 token
在一个大多数竞争对手目前并未持续推进的领域,Gemini 4 Argon 有一个有趣的新特性——输出 token 上限。目前 100 万输入 token 已成为前沿模型的标配,而 Gemini 4 Argon 还能生成最多 100 万输出 token,此前 Gemini 模型的输出上限仅为 64,000。
Google 在公告中写道:"当模型有足够的空间进行深入思考,并在单次推理轨迹中生成数十万 token 时,它为一次性解决难题增添了全新的推理深度。"
在网络安全方面,Google 表示已训练 Argon 能够自主发现、验证并修复软件漏洞。对于 Fairwind 参与者和 Google 内部团队,Google 将在没有网络安 全护栏的情况下发布该模型。
Google 于 3 月以 320 亿美元收购的 Wiz,已在其 Scan for Good 计划中使用 Argon。Google 表示,该模型发现了一个全球医院使用的医疗软件中的关键漏洞,此前的前沿模型均未能发现。
Argon 在 Google 内部漏洞发现基准测试中取得 85.8%,在 Wiz 渗透测试基准测试中取得 70.9%,不过 Google 仅与自家 Gemini 3.8 Flash Cyber 进行了对比(分别为 71.0% 和 58.2%)。
Google 表示,在推广期间,Argon 的定价为每百万输入 token 2 美元、每百万输出 token 10 美元;之后将调整为 4 美元和 20 美元。调整后的输出价格与 Anthropic 对 Opus 5.5 收取的每百万输出 token 20 美元持平,而考虑到 Argon