Gemini 3.8 Flash 在部分编程基准追上 Claude Opus 5,但「努力思考」导致每任务输出 token 多约 30%,实际成本高于前代。
Gemini 3.7 Flash 发布三周后,Google 又带来了 Gemini 3.8 Flash。这款平价模型号称在编程能力上大幅超越前代。
Google 发布了两个版本的 Gemini 3.8 Flash:一款通用推理编程模型,一款名为 3.8 Flash Cyber 的专精网络安全版本。这是六周内第三款 Flash 系列发布,如此密集的更新节奏究竟代表着实力还是一种分心——让人忽略至今仍未露面的前沿模型 Gemini 3.5 Pro 和 Gemini 4——取决于你问谁。新任 Deepmind 负责人 Koray Kavukcuoglu 明确表示,Google 不仅仅在追逐价格性能优化,仍然希望在原始能力上保持领先。
根据 Google 自家的数据,Gemini 3.8 Flash 在长周期软件工程任务基准 DeepSWE v1.1 上达到了 73.7%。略低于 Claude Opus 5 的 74.0%,但大幅领先 Claude Sonnet 5(53.8%)、GPT-5.6 Sol(72.7%)以及前代 3.7 Flash(65.3%)。
Google 表示,尽管价格低得多,但 Gemini 3.8 Flash 在多项基准测试中超越了 Anthropic 的 Opus 5 和 OpenAI 的 GPT-5.6 Sol。不过这只是基准测试,实际使用中的表现可能差异很大。

Google 还表示,新模型在 3D 生成方面有所提升。下方视频展示了 Gemini 3.8 Flash 据说在 Google AI 编程工具 Antigravity 中仅凭一条 prompt 构建出的 3D 游戏。纹理由 Google 的 Nano Banana 图像模型生成。
Gemini 3.8 Flash 以优惠价格上线:每百万输入 token 0.75 美元,每百万输出 token 3.75 美元,与 3.7 Flash 持平。2027 年 1 月起,常规价格将上涨至 1.50 美元和 7.50 美元。Claude Opus 5 每百万输入 token 收费 5.00 美元,输出 token 25.00 美元;GPT-5.6 Sol 则为 4.00 美元和 20.00 美元。即使优惠期结束,Gemini 3.8 Flash 按每 token 计算仍然远低于 OpenAI 和 Anthropic 的顶级模型。
但 Google 解释性能提升时表示,部分原因是 3.8 Flash 在复杂任务上运行了额外的推理步骤并迭代调用工具。Google 称模型"更努力地工作",这意味着更高的 token 消耗,部分抵消了更低的每 token 价格。对于计算效率优先的使用场景,Google 推荐使用较低的推理级别,或继续使用仍在支持的 3.7 Flash。
Gemini 3.8 Flash 可通过 Google AI Studio、Google Antigravity 和 Android Studio 供开发者使用。企业用户可通过 Gemini Enterprise 访问。消费者则可以在 Gemini 应用、Google Search 的 AI Mode 中使用,以及付费订阅者在 Google Sheets 中使用。
性价比出色,但 token 消耗不可忽视
独立基准测试平台 Artificial Analysis 给 Gemini 3.8 Flash 的 Intelligence Index 打出了 59 分,比前代 3.7 Flash 的 56 分高出 3 分。这与 GPT-5.6 Sol 在 xhigh 推理级别和 Grok 4.6 在 medium 推理级别的得分持平,两者也都是 59 分。据 Artificial Analysis 介绍,Intelligence Index 的提升主要来自代理基准测试(如工具使用和编程任务)的更强表现。
Gemini 3.8 Flash 在 Artificial Analysis Intelligence Index 上得分 59,与 GPT-5.6 Sol 和 Grok 4.6 持平。在成本性能图表(下图)中,该模型位于帕累托前沿,以其智能水平提供了最低的每任务成本。| 图片:Artificial Analysis

在每任务成本上,3.8 Flash 达到了帕累托前沿,每任务成本为 0.58 美元,是其智能水平下最便宜的模型。但与 3.7 Flash 的 0.40 美元相比上升了约 40%,尽管每 token 价格保持不变。这或许是 Google 推荐对效率敏感的工作负载继续使用 3.7 Flash 的原因。
在高推理级别下,3.8 Flash 每秒约生成 300 个输出 token,平均每任务耗时 2.5 分钟。比 GPT-5.6 Luna(2.6 分钟)和 GPT-5.6 Terra(3.3 分钟)略快,但慢于 Claude Fable 5.1(2.1 分钟)和更老的 3.7 Flash(2.2 分钟)。在低推理级别下,时间降至约 48 秒。
网络安全模型仅对认证防御者开放
Gemini 3.8 Flash Cyber 与其前代 3.5 Flash Cyber 一样,不对公众开放。Google 通过 Fairwind Program 向政府机构、关键基础设施运营商和软件维护者分发该模型。该模型的安全设置比标准版限制更少,因为它专为防御性网络安全工作而构建。
在 CyberGym——检测 C/C++ 漏洞的行业标准基准——上,3.8 Flash Cyber 据 Google 称得分 86.2%,超越了前代 3.5 Flash Cyber(77.5%)、GPT-5.6 Sol(83.6%)和 GPT-5.5-Cyber(85.6%)。在外部 CWE-Bench 的自动补丁测试中,3.8 Flash Cyber 达到 47.2% 的 Pass@1,几乎追平领先的前沿模型 47.8%,而成本却低得多。
该模型在对抗 prompt 注入攻击方面似乎也更具韧性。在 Gray Swan IPI 基准上,Gemini 3.8 Flash 的攻击成功率仅为 5.5%。DeepSeek V4 Pro 为 60.1%,Kimi K3 为 52.7%,Grok 4.6 为 51.8%。只有 Anthropic 的 Claude Opus 5 表现略好,为 4.8%,而 Opus 5 配合额外安全选项在 Claude 生态内得分更低。