Google 推出网络安全专向轻量模型
Gemini 3.5 Flash Cyber 专为漏洞发现和补丁设计。对 DevSecOps 和安全工程师的生产力有直接提升。
Gemini 3.5 Flash Cyber 专为漏洞发现和补丁设计。对 DevSecOps 和安全工程师的生产力有直接提升。
Raluca Ada Popa、Four Flynn
多年来,Google 一直持续投入网络安全领域,并率先探索自动化漏洞发现技术,以保护全球代码库的安全。以我们的代码安全 Agent CodeMender 为例,它能够自动发现并修复严重的软件漏洞。然而,随着 AI Agent 发现漏洞的速度越来越快,甚至超过防御者修复漏洞的速度,要应对这一全球性威胁,就必须采用一种能力强大、成本可控且能够规模化的方法。
今天,我们将进一步拓展长期以来为防御者提供支持的工作,正式推出 Gemini 3.5 Flash Cyber。这是一款基于 3.5 Flash 构建的轻量级网络安全模型,并经过专门微调,能够快速、高效地发现、验证和修补漏洞,在这些任务上的表现优于 Gemini 主线 Flash 模型。
Flash 出色的性能和效率,使其成为我们构建网络安全模型的理想基础。3.5 Flash Cyber 基于 Flash 打造,与体量庞大、成本高昂的网络安全模型相比,既具备强大的能力,又拥有更高的成本效益。
考虑到这项技术具有双重用途,我们在部署 3.5 Flash Cyber 时采取了审慎而有针对性的方式。作为限量访问试点计划的一部分,3.5 Flash Cyber 即将通过 CodeMender 仅向政府机构和可信合作伙伴开放,之后再逐步扩大使用范围。这将帮助一线防御者抢占先机,在严重漏洞被利用之前发现并修复它们,同时降低技术被大范围滥用的风险。
除此之外,我们还将通过 Gemini Enterprise Agent Platform,借助已正式开放使用的 Gemini 模型,直接向客户提供 CodeMender 的基础能力。
要发现深藏于代码中的缺陷,就需要探索规模极其庞大的执行搜索空间。如果只依赖一次昂贵的大型语言模型调用,很容易形成瓶颈。对于那些要求 Agent 扫描大型代码库并分析大量代码路径的漏洞发现任务,3.5 Flash Cyber 尤其适合。
CodeMender 会多次调用 3.5 Flash Cyber,使 Agent 能够分析远多得多的代码路径,从而发现并验证漏洞。随后,各个 sub-agent 会共同生成一份高质量的最终报告。
凭借速度和成本优势,3.5 Flash Cyber 可以轻松、大规模地集成到高频扫描、时间敏感的发布流程或 commit 扫描流水线中。
我们使用多项基准测试评估了 3.5 Flash Cyber。具体来说,我们在 CyberGym 基准测试中对其进行了测试。CyberGym 会使用数百个真实世界的软件漏洞评估 AI Agent。为了充分利用 3.5 Flash Cyber 的低成本优势,我们将 CodeMender 配置为针对一份最终报告最多调用五次 3.5 Flash Cyber。最终,整个 Agent 在 CyberGym 上取得了足以与体量大得多的模型竞争的成绩*。
CyberGym 成功率(pass@1)
*竞争对手的结果来自各提供商自行公布的分数
我们还移除安全护栏,对模型在 CyberGym 之外的能力进行了压力测试。Google 的 Big Sleep 团队独立构建了一套评估,重点考察模型能否在 Chrome 和 Safari 等全球最复杂的代码库中,发现严重且难以定位的漏洞。在这项评估中,3.5 Flash Cyber 的表现显著超过主线 3.5 Flash 和 3.6 Flash。
Big Sleep 评估成功率(pass@1)
我们还在 Google Chrome 的生产环境 commit 扫描流水线中评估了 3.5 Flash Cyber。相关漏洞从未公开披露,因此可以确保这项基准测试对于 Gemini 和竞争对手模型而言都不存在数据污染。
结果显示,与 3.5 Flash 相比,3.5 Flash Cyber 的表现有了显著提升。需要说明的是:Opus 4.6 之后发布的较新竞争对手模型版本,会因为内置安全护栏而拒绝执行这些任务,因此未在结果中展示。
Chrome 生产环境 commit 扫描流水线成功率(pass@1)
此外,与主线 3.5 Flash 和 Claude Opus 4.6 相比,3.5 Flash Cyber 始终能够发现更多不同的漏洞。在调用次数固定的情况下,我们使用高度复杂的 V8 JavaScript Engine 进行测试。3.5 Flash Cyber 发现了 55 个不同且经过确认的问题,主线 3.5 Flash 发现了 47 个,Opus 4.6 则发现了 36 个。其中有 10 个问题是另外两个受测模型都未能发现的。
基础网络安全模型可能会陷入循环,反复发现同一个问题,却遗漏严重漏洞。能力强大的模型能够扩大搜索范围,发现更多不同的问题。
随着调用次数增加,我们发现 3.5 Flash Cyber 仍能不断探索新的代码路径并发现新的漏洞。
基准测试只能反映部分情况。CodeMender 中的 3.5 Flash Cyber 已经在 Google 内部代码库中发现并修复漏洞,覆盖 Chrome、Android、Cloud、Ads 和 YouTube 等产品与业务。
轻量级模型带来的漏洞发现速度已经产生了可量化的实际成效。
例如,Google Cloud Vulnerability Research 团队使用 3.5 Flash Cyber,以创纪录的速度主动保护我们的系统。仅用两个小时,该模型就在公共 API 中发现了远程代码执行漏洞,并在一项敏感的生产服务中发现了内存损坏漏洞。随后,它生成了一个可靠性达到 100% 的远程代码执行 exploit,能够绕过 Address Space Layout Randomization(ASLR)和 Write XOR Execute(W^X)等标准缓解技术。
来自 Wiz 和 Cloud CISO Security Engineering 测试人员的早期反馈证实,与主线 3.5 Flash 模型相比,3.5 Flash Cyber 的能力有了显著提升。
Google 在软件安全领域的领先地位为我们带来了独特优势。例如,由 Google 运营的漏洞数据库 OSV.dev 收录了超过 70 万个开源漏洞,再加上 OSS-Fuzz 十多年来积累的结果,可以帮助我们识别质量最高的漏洞。
借助这些资源,我们能够超越合成的网络安全示例,教会模型像真正的安全专业人员一样工作。我们的模型会学习使用行业标准工具、阅读 Chromium 等大型项目中的数百万行代码,并独立处理需要持续数小时进行深度分析的复杂安全任务。
通过使用 3.5 Flash Cyber 为 CodeMender 提供能力,我们正在构建一种能力强大、可规模化且成本可控的架构,帮助更多防御者保护软件安全。