Gemini 3.8 Flash和3.8 Flash Cyber连续推出,Flash系列迭代速度加快,Google正以高频小版本更新争夺市场份额。
Google 已经在六周内发布了第三个 Gemini Flash 模型
周三,Google 发布了新一套 Gemini Flash 和 Flash Cyber 模型,尽管 Gemini 3.7 Flash 才发布三周(这是 Google 六周内的第三个 Flash 版本),但新 Flash 模型通常在性能上大幅领先,尤其是在 agentic 编程任务和 agentic 计算机使用场景中。
与之前一样,Flash 3.8 的定价为每百万输入/输出 token 0.75 美元/3.75 美元。不过这是首发价格,将于 2026 年 12 月 31 日到期,届时调整为 1.50 美元/7.50 美元。
Fairwind 对 Flash 3.8 Cyber 进行分级
Flash 3.8 看起来是一个非常出色的模型,Google 称其为"主力模型"也无可厚非,但 Flash 3.8 Cyber 同样值得关注。通过这款模型,Google 基本上是在效仿 Anthropic 的打法。
Google 将 Cyber 模型描述为"最具能力的网络安全模型,在漏洞检测和自动修复方面具有前沿级性能"。正因如此,它仅通过 Google 称之为 Fairwind 的新计划向精选的"可信防御者"提供。
这些可信防御者包括约 650 家合作伙伴,如 Accenture、CrowdStrike、互联网安全中心、Datadog、Palo Alto Networks、Snowflake 和 Wiz。
Google 安全与隐私副总裁 Four Flynn 在公告中写道:"防御者的优势在于缩短了从发现缺陷到修复缺陷之间的时间。通过 Google 的 Fairwind 计划,政府和企业合作伙伴获得自主工具,以更快的速度和规模化修复系统,在 agentic 速度威胁面前保持领先。"
早在 Flash 3.5 Cyber 时,Google 就推出了一个有限访问计划,但当时没有正式命名,看起来有些临时起意。
Gemini 3.8 Flash:长程编程与 agents
至于 Flash 3.8,Google 指出,在复杂工程任务方面,新模型通常优于 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Claude Sonnet 5 及 Opus 5 等模型。例如,在 DeepSWE 等基准测试中,它与 Opus 5 持平,胜过 GPT-5.6 Sol 和 Sonnet 5。
不过,这里有一个注意事项,Google 也强调"3.8 Flash 更加努力"。但更努力意味着它会使用更多 token,Google 坦言这一点,并指出:"在复杂任务中,它表现出更高的严谨性——执行额外的推理步骤,迭代调用工具。有时,模型可能会使用更多 token 以最大化性能,尤其是在较高努力级别下。"
不过,开发者可以在不同的推理模式之间选择,就像之前的模型一样。

Google 的基准测试并未包含 Anthropic 的 Fable 5.1——该模型仅在一天前发布。那是一个强大得多的模型,但成本也高得多。
没有人会把 Fable 5.1 称为主力模型,但值得指出的是,在通用 agentic 基准测试(如 Terminal-Bench 4.0)中,Flash 3.8 得分为 19.1%,而 Fable 5.1 达到 55.8%,Opus 5 为 51.8%。同时,在聚焦编程的 Terminal-Bench 2.1 上,Flash 3.8 表现优于竞争对手。
不过 Terminal-Bench 在这里是个异类,因为 Gemini 模型在其他 agentic 任务上实际上表现相当出色,即使与其他旗舰模型相比也是如此。
尽管取得了一些令人瞩目的进步,Google 的模型在计算机使用(59% 对比 Opus 5 的 75.4%,OSWorld-2.0)以及 GDPVal(一个测试模型知识工作任务的基准)方面仍然吃力。Google 在 1545 分,仍远落后于 Opus 5 的 1824 分,但终于在赶上 Sonnet 5 的 1584 分。
Google 指出,它能够在如此短的时间内改进模型,部分原因是它现在也在使用 agentic 循环来改进模型。"今天的两个发布都基于相同的基础智能,并通过长期运行的 agentic 循环进一步加速,这些循环旨在递归评估和优化底层模型,"团队写道。
中国模型正在缩小差距
值得注意的一点是,Google 的比较聚焦于 OpenAI 和 Anthropic,但在 DeepSWE 1.1 等某些基准测试中,很难不注意 GLM-5.3 和 GLM-5.3 Flash、DeepSeek v4 Pro 以及 Kimi K3 等中国模型同样处于同一梯队——而且它们通常提供更好的性价比。

至于 Flash 3.8 Cyber,Google 表示它在 CyberGym 上提供了"自主漏洞发现的前沿级性能",击败了 7 月发布的 3.5 Flash Cyber 以及"明显更大的前沿模型"。
CyberGym 仅覆盖 C 和 C++ 代码,因此 Google 还在一个涵盖 20 种语言的内部基准上测试了该模型,报告成功率达到 70% 以上。
在 Collinear 的 CWE-Bench 上,该模型的 pass@1 得分为 47.2%,仅次于 Google 未具名的"领先前沿模型"的 47.8%。
不过基准测试终究有限。Chrome 安全团队表示,该模型产生的正确补丁比"更大得多的最佳商业模型"多 2.6 倍,而 Wiz 报告在其内部渗透测试基准上,召回率高出 7.5% 至 9.7%,成本仅为后者的 2.3 至 5.2 分之一。
在安全方面,Google 表示 3.8 Flash "针对化学、生物、放射性和核(CBRN)以及网络攻击领域的滥用提供了防护措施,同时按照我们的前沿安全框架启用了有益用例。"
Gemini Flash 3.8 Cyber 有一套更宽松的防护措施,但这也是它仅向精选用户群提供的原因。
Google 确实指出,新模型在 prompt 注入方面更加稳健,例如在 Gray Swan IPI 基准测试中取得了(几乎)领先同行的结果。

下一个 Gemini Pro 模型的发布将会很有趣。这些 Flash 模型正在快速改进,虽然 Google 在 Pro 发布上有些失手,但该模型可能值得等待。Google 在此期间押注 Flash 模型的策略也意味着,它能够讲述一个对其他美国前沿实验室来说更难讲述的性价比故事。
不过照这个速度,在 Gemini 4 Pro 到来之前,我们可能会看到 Gemini 3.9 Flash。
Gemini 3.8 Flash 现已在 Antigravity、Google AI Studio、Android Studio、Stitch 以及 Gemini Enterprise 等常见 Google 产品中可用。
拥有 AI Pro 和 Ultra 订阅的消费者也可以在 Gemini App、Google Search 中的 AI Mode 以及 Google Sheets 的 Gemini 中使用它。