据文中引用的评测,Gemini 4 Argon 与 GPT-6 Sol 的 token 标价相同,但每项任务成本分别约为 1.99 和 1.05 美元。作者将差距归因于 token 消耗,并结合输出速度讨论能力提升带来的成本与耗时取舍。
最初发布于 saksham.digital/blog。
Google 昨天推出了 Gemini 4 Argon,每百万输入 token 的价格为 $2,每百万输出 token 为 $10,与 GPT-6 Sol 的标价完全相同。但在 Artificial Analysis 的测试中,Argon 每项 Intelligence Index 任务的成本为 $1.99,Sol 则为 $1.05。
Argon 确实是 Google 的一次大幅跃升。Artificial Analysis 给出的 Intelligence Index 得分为 53,与 GPT-6 Astra 持平,比 Gemini 3.1 Pro Preview 高出 23 分。Google 自己的对比表显示,它在 19 项指标中领跑了 13 项。它还将输出上限从 64K token 提高到了 1M token,对于单次响应来说,这个数字相当惊人。
但看看价格页面没有告诉你的事。按 token 计费,Argon 和 Sol 完全一样;按任务算,Argon 却贵了约 1.9 倍。价格相同,任务相同,所以差距全在 token 用量上:完成同样的工作,Argon 消耗的 token 大约是 Sol 的两倍。
这才是你实际花钱购买的分数。Argon 的指数得分比 Sol 高出约 5 分(OrcaRouter 对 AA 数据的细分分析中,两者分别为 52.6 和 47.5),而你要通过输出 token,为这几分的提升买单。
同一份分析还列出了输出速度:Argon 为 48.9 tokens/sec,Sol 为 77.0 tokens/sec。再把 token 用量算进去:
每项任务的实际耗时大约是 3 倍。
这是个粗略估算,假设输出 token 占据了主要耗时,实际延迟还取决于负载。但对于每一轮都要等待模型返回的 Agent 循环来说,3 倍的差距意味着:一个工具用起来像是即时交互,另一个则让你开着它,转身去泡杯印度奶茶。
这个价格是首发优惠价,之后会涨到 $4 / $20。届时,AA 估算的每项任务成本将达到 $3.98,约为 GPT-6 Astra 在 max 档位下的 1.2 倍。“成本只有 Astra 的 60%”这个宣传说法,是有有效期的。
你现在还用不上它。它会先向 Google Fairwind Program 中的网络防御人员开放,再向付费 API 客户和 AI Ultra 订阅用户开放,目前没有公布具体日期。
而且,它也不是样样领先。Google 自己的表格显示,它在 FrontierSWE v2 上落后于 Astra(55.0% 对 65.5%),在 Terminal-Bench 4.0 上落后于 Opus(57.4% 对 66.4%),在 OSWorld-2.0 上也落后于对手(69.2% 对 72.6%)。如果你的工作负载是需要长时间运行的 Agent 编程任务,这三项指标才最值得关注。
这已经是一周内第二次有新模型发布,指向同一个结论。Ember-1 通过减少思考降低了成本;Argon 变得更聪明,部分原因则是思考得更多。无论哪一种,每 token 的价格都是页面上最没参考价值的数字。
对于所有基于这些模型构建应用的人,你真正需要比较的是:在自己的工作负载上,每解决一项任务要花多少钱、需要多少秒。每百万 token 的价格只是单位成本。你的账单等于单位成本乘以用量,而用量是模型决定的,不是你决定的。
我的评估系统已经在记录每项任务的 token 用量。看完这次发布,我准备在旁边再加上每项任务的实际耗时。我正在 github.com/saksham10arora-dotcom 公开构建这套系统。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。