Gemini 3.8 Flash系列新增网络专项版本Cyber,Google在六周内完成第三次Flash线更新。
我们的最新 Gemini 模型为智能体工作流和网络安全领域带来下一代智能。
产品管理高级总监
Gemini 安全负责人,Google DeepMind
继三周前发布 3.7 Flash 并在短短六周内完成第三次 Flash 更新之后,今天我们正式推出 Gemini 3.8——我们迄今为止最强的推理与编码模型,同时保持与 3.7 相同的高速和低成本。Gemini 3.8 包含两个版本:
Gemini 3.8 Flash:我们最智能的主力模型,在软件工程、智能体任务和专业领域的多步推理方面较 3.7 Flash 有显著提升。定价与 3.7 Flash 相同,每百万输入 tokens 0.75 美元,每百万输出 tokens 3.75 美元。
Gemini 3.8 Flash Cyber:我们最具能力的网络安全模型,在漏洞检测和自动修复方面达到前沿级别性能,通过我们的全新 Fairwind Program 向可信防御者提供。
虽然针对不同的部署环境定制,但今天的两个版本都基于相同的基础智能,并借助长时间运行的智能体循环进一步加速,该循环递归评估和优化底层模型。共享核心在编码和推理方面的显著提升源于多项创新,包括在要求极高的网络安全领域的严格训练。
Gemini 3.8 Flash:为长期编码和自主智能体打造
Gemini 3.8 Flash 实现了相对于 3.7 Flash 的实质性提升,往往接近更高成本的前沿模型性能。
在 DeepSWE v1.1(长期软件工程)上,3.8 Flash 以极低的成本自主端到端解决复杂工程问题的表现优于大多数更大的前沿模型。
此外,3.8 Flash 在专业知识领域表现出关键企业自主性所需的可靠性。在需要高级分析和报告的量化及专业领域,3.8 Flash 在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 等基准测试中优于 3.7 Flash 和其他前沿模型。3.8 Flash 还在 HLE-Verified 上达到 54.9%,展示了其在 STEM、人文和专业领域处理多步推理的能力。
这些性能提升源于一个核心设计选择:3.8 Flash 更加努力。在复杂任务中,它表现出更高的严谨性——执行额外的推理步骤,迭代调用工具。有时模型可能会使用更多 tokens 以最大化性能,尤其是在更高努力级别下。
对于计算效率是主要约束的应用,开发者可以利用较低的努力级别来最小化 token 开销,或者继续使用 Gemini 3.7 Flash,它仍被完全支持用于效率优先的工作负载。
Gemini 3.8 Flash 在 Google Antigravity 中仅用一个简单 prompt 构建了这款游戏。游戏使用谜题、环境叙事和 Nano Banana 生成的纹理,创建了一个沉浸式 3D 关卡,你扮演一名在城堡中导航的巫师。
Gemini 3.8 Flash 在 Google Antigravity 中用单个 prompt 构建了一个功能完整的 DOS 版本 Google Maps,可使用地点、方向和街景进行完全可玩的体验。
使用 Gemini 3.8 Flash 在 Google Antigravity 中基于美国地质调查局的真实数据集构建的著名地理地点地形图,探索实时横截面、2D 投影和科学解释。
Hardware Anatomy 是一个由 Gemini 3.8 Flash 在 Google AI Studio 中构建的交互式 3D 可视化工具,生成按物理比例的硬件设备拆解的逼真 Three.js 渲染。它自动将设备分解为可使用拆解滑块爆炸和检查的各个层级。
Gemini 3.8 Flash Cyber:专家级网络性能
Gemini 3.8 Flash Cyber 通过 Fairwind Program 向一组可信防御者提供,在当今复杂的网络安全领域提供决定性优势,同时具备 Flash 的速度和成本,支持快速迭代。
自主漏洞发现
在行业标准的漏洞发现基准测试 CyberGym 上,Gemini 3.8 Flash Cyber 在自主漏洞发现方面展现出前沿级性能。它超越了 3.5 Flash Cyber 以及明显更大的前沿模型。
为了更好地捕捉现实世界的防御需求——不仅限于 CyberGym 中的 C/C++ 代码库——我们还在一个综合内部基准测试中评估了 Gemini 3.8 Flash Cyber,其中模型需要在涵盖 20 种编程语言的复杂代码库中发现各种漏洞。在这项测试中,模型展示了相对于我们之前模型的惊人飞跃,成功率超过 70%。
借助 Gemini 3.8 Flash Cyber,我们专门专注于为防御者提供优于攻击者的专家能力。这就是为什么从一开始我们就投资于漏洞修复,并将其置于利用等进攻能力之上。
Collinear 运行的 CWE-Bench 是一个具有挑战性的补丁能力外部基准测试。在该基准测试中,Gemini 3.8 Flash Cyber 处于帕累托前沿:pass@1 为 47.2%,而领先的前沿模型为 47.8%,但成本显著更低。
实际影响:保护 Google 的代码
我们已经使用 Gemini 3.8 Flash Cyber 来保护 Google 各处的代码。例如:
Chrome 安全团队发现,3.8 Flash Cyber 对 Chrome 漏洞生成的正确补丁数量是更大商业模型的最佳表现的 2.6 倍。
Wiz 发现,Gemini 3.8 Flash Cyber 在其内部渗透测试基准测试中实现了比其他领先前沿模型高 7.5-9.7% 的召回率,而成本仅为后者的 1/2.3 至 1/5.2。
Google 云漏洞研究团队利用 3.8 Flash Cyber 模型在不到 2 小时内发现了一个关键基础漏洞,此类研究和发现通常需要数月时间。
我们的 Fairwind Program 合作伙伴评价
内置安全设计
根据我们的前沿安全框架,3.8 Flash 在化学、生物、放射性和核(CBRN)以及网络攻击领域内置了防止滥用的保障措施,同时支持有益的用例。3.8 Flash Cyber 携带一套更为宽松的网络安全缓解措施,因此仅供需要更全面网络能力的可信防御者使用。
Gemini 3.8 模型在 Gray Swan 衡量的提示注入鲁棒性方面也取得了显著飞跃,保护 Gemini 模型用户免受与提示注入相关的恶意攻击。
Gemini 3.8 Flash 和 Cyber:今天就开始
开发者:用 3.8 Flash 构建,在 Google Antigravity 中探索智能体优先工作流,或通过 Google AI Studio 和 Android Studio 在 Gemini API 中开始构建,或在 Stitch 中生成 UI。查阅我们的开发者文档开始。
企业:在 Gemini Enterprise 中访问 3.8 Flash。
消费者:3.8 Flash 已面向 Google AI Pro 和 Ultra 订阅者在 Gemini 应用、Google Search 的 AI Mode 和 Google Sheets 中的 Gemini 上可用。
网络安全:通过我们的全新 Fairwind Program,我们为可信政府机构、关键基础设施运营商和软件维护者提供 Gemini 3.8 Flash Cyber 的优先访问。申请访问。