前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8655
  • Claude 不是编译器:LLM 使用者必须懂的底线
  • Nativ:Mac 本地运行 AI 模型的桌面工具
  • JetBrains Context:代码库智能层让 Agent 理解复杂项目
  • Claude Code 团队访谈:工具设计、安全与实践
  • 全栈开发演变:从快速原型到 Agentic 工程
  • OpenAI 与 Hugging Face 披露模型评估安全事件
  • Grabette:开源机器人操作数据采集工具
  • NVIDIA 在 SIGGRAPH 展示图形和仿真 AI 进展
  • AI 生成代码的法律困局:责任、所有权与风险
  • Import AI 465:开闭模型差距与政策展望
  • RTK Skill 真能省 60-90% token?官方实测拆解
  • 长周期模型的安全部署经验
  • AI 招聘筛选会比人工产生更多偏见
  • Sam Altman 论开源模型战略
  • Claude Fable 证明数学猜想引关注
  • OpenAI Codex 上下文窗口缩小至 272k
  • Claude Code 已采用 Rust 版 Bun
  • 浏览器中的交互式 SQLite 查询解释器
  • Mac 远程控制指南:为 Claude Code 配置专用机器
  • LLM 推理效率控制的三档模式
  • Google 推出网络安全专向轻量模型
  • Claude Code 的设计缺陷分析
  • 企业 AI 投资价值评分卡框架
  • 团队协作与 Agent 编程的平衡
  • Kimi K3 成全球最大开源模型之一
  • Cursor 在 Slack 支持多仓库和执行计划预览
  • 本地运行 AI 模型的硬件成本对比
  • LM Studio Bionic:开源模型驱动的本地 AI Agent
  • Claude Fable 5 与 GPT-5.6 视频生成对标
  • AI 生成代码的隐性债务问题
  • 1-Bit 量化 LLM 的浏览器推理方案
  • 用经典机器学习检测 AI 生成文本
  • Google AI 支持多应用服务集成
  • 科学数据成为 AI 训练的新frontier
  • LLM 批评有据,我仍在使用
  • 微调 vs RAG:生产环境 LLM 应该怎么选
  • OpenAI Codex 赋能创意工具快速迭代
  • Thinky 开源 Inkling 多模态大模型
  • Cars24 用 OpenAI Agent 实现百万级对话规模
  • Hugging Face 安全事件披露
  • NVIDIA 推出边缘 AI 新硬件 Jetson Thor
  • Shadcn 组件库复刻 Claude 风格 UI
  • 开源975B大模型Inkling发布
  • AI Agent何时停止猜测:Qwen+MCP实战
  • GPT-Red:通过自对弈提升模型安全和抗注入能力
  • 掌控系统全链路:工程师的三重责任论
  • Real World VoiceEQ:量化语音 AI 的人类感知质量
  • Hugging Face 推出 Thinking Machines 的 Inkling 项目
  • Codex 日增 100 万用户,AI 编程工具增速惊人
  • 2026 年 AI 工程五大趋势:从工具到 Agent 系统化
  • dev.to博客数据CLI工具,AI代码审查器git-lrc
  • 已加载 51 / 8655
7.0
热点
AI SCORE
工具产品2026-07-17 23:00

Google 推出网络安全专向轻量模型

Google DeepMind#Google#安全工具
Editor brief · 编辑速览

Gemini 3.5 Flash Cyber 专为漏洞发现和补丁设计。对 DevSecOps 和安全工程师的生产力有直接提升。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Raluca Ada Popa、Four Flynn

多年来,Google 一直持续投入网络安全领域,并率先探索自动化漏洞发现技术,以保护全球代码库的安全。以我们的代码安全 Agent CodeMender 为例,它能够自动发现并修复严重的软件漏洞。然而,随着 AI Agent 发现漏洞的速度越来越快,甚至超过防御者修复漏洞的速度,要应对这一全球性威胁,就必须采用一种能力强大、成本可控且能够规模化的方法。

今天,我们将进一步拓展长期以来为防御者提供支持的工作,正式推出 Gemini 3.5 Flash Cyber。这是一款基于 3.5 Flash 构建的轻量级网络安全模型,并经过专门微调,能够快速、高效地发现、验证和修补漏洞,在这些任务上的表现优于 Gemini 主线 Flash 模型。

Flash 出色的性能和效率,使其成为我们构建网络安全模型的理想基础。3.5 Flash Cyber 基于 Flash 打造,与体量庞大、成本高昂的网络安全模型相比,既具备强大的能力,又拥有更高的成本效益。

考虑到这项技术具有双重用途,我们在部署 3.5 Flash Cyber 时采取了审慎而有针对性的方式。作为限量访问试点计划的一部分,3.5 Flash Cyber 即将通过 CodeMender 仅向政府机构和可信合作伙伴开放,之后再逐步扩大使用范围。这将帮助一线防御者抢占先机,在严重漏洞被利用之前发现并修复它们,同时降低技术被大范围滥用的风险。

除此之外,我们还将通过 Gemini Enterprise Agent Platform,借助已正式开放使用的 Gemini 模型,直接向客户提供 CodeMender 的基础能力。

搜索空间问题:轻量级模型在代码安全中的优势

要发现深藏于代码中的缺陷,就需要探索规模极其庞大的执行搜索空间。如果只依赖一次昂贵的大型语言模型调用,很容易形成瓶颈。对于那些要求 Agent 扫描大型代码库并分析大量代码路径的漏洞发现任务,3.5 Flash Cyber 尤其适合。

CodeMender 会多次调用 3.5 Flash Cyber,使 Agent 能够分析远多得多的代码路径,从而发现并验证漏洞。随后,各个 sub-agent 会共同生成一份高质量的最终报告。

凭借速度和成本优势,3.5 Flash Cyber 可以轻松、大规模地集成到高频扫描、时间敏感的发布流程或 commit 扫描流水线中。

3.5 Flash Cyber 基准测试结果:大型网络安全模型之外的高效选择

我们使用多项基准测试评估了 3.5 Flash Cyber。具体来说,我们在 CyberGym 基准测试中对其进行了测试。CyberGym 会使用数百个真实世界的软件漏洞评估 AI Agent。为了充分利用 3.5 Flash Cyber 的低成本优势,我们将 CodeMender 配置为针对一份最终报告最多调用五次 3.5 Flash Cyber。最终,整个 Agent 在 CyberGym 上取得了足以与体量大得多的模型竞争的成绩*。

CyberGym 成功率(pass@1)

*竞争对手的结果来自各提供商自行公布的分数

我们还移除安全护栏,对模型在 CyberGym 之外的能力进行了压力测试。Google 的 Big Sleep 团队独立构建了一套评估,重点考察模型能否在 Chrome 和 Safari 等全球最复杂的代码库中,发现严重且难以定位的漏洞。在这项评估中,3.5 Flash Cyber 的表现显著超过主线 3.5 Flash 和 3.6 Flash。

Big Sleep 评估成功率(pass@1)

我们还在 Google Chrome 的生产环境 commit 扫描流水线中评估了 3.5 Flash Cyber。相关漏洞从未公开披露,因此可以确保这项基准测试对于 Gemini 和竞争对手模型而言都不存在数据污染。

结果显示,与 3.5 Flash 相比,3.5 Flash Cyber 的表现有了显著提升。需要说明的是:Opus 4.6 之后发布的较新竞争对手模型版本,会因为内置安全护栏而拒绝执行这些任务,因此未在结果中展示。

Chrome 生产环境 commit 扫描流水线成功率(pass@1)

此外,与主线 3.5 Flash 和 Claude Opus 4.6 相比,3.5 Flash Cyber 始终能够发现更多不同的漏洞。在调用次数固定的情况下,我们使用高度复杂的 V8 JavaScript Engine 进行测试。3.5 Flash Cyber 发现了 55 个不同且经过确认的问题,主线 3.5 Flash 发现了 47 个,Opus 4.6 则发现了 36 个。其中有 10 个问题是另外两个受测模型都未能发现的。

基础网络安全模型可能会陷入循环,反复发现同一个问题,却遗漏严重漏洞。能力强大的模型能够扩大搜索范围,发现更多不同的问题。

随着调用次数增加,我们发现 3.5 Flash Cyber 仍能不断探索新的代码路径并发现新的漏洞。

实际应用与 Google 防御能力的规模化

基准测试只能反映部分情况。CodeMender 中的 3.5 Flash Cyber 已经在 Google 内部代码库中发现并修复漏洞,覆盖 Chrome、Android、Cloud、Ads 和 YouTube 等产品与业务。

轻量级模型带来的漏洞发现速度已经产生了可量化的实际成效。

例如,Google Cloud Vulnerability Research 团队使用 3.5 Flash Cyber,以创纪录的速度主动保护我们的系统。仅用两个小时,该模型就在公共 API 中发现了远程代码执行漏洞,并在一项敏感的生产服务中发现了内存损坏漏洞。随后,它生成了一个可靠性达到 100% 的远程代码执行 exploit,能够绕过 Address Space Layout Randomization(ASLR)和 Write XOR Execute(W^X)等标准缓解技术。

来自 Wiz 和 Cloud CISO Security Engineering 测试人员的早期反馈证实,与主线 3.5 Flash 模型相比,3.5 Flash Cyber 的能力有了显著提升。

规模化赋能防御者

Google 在软件安全领域的领先地位为我们带来了独特优势。例如,由 Google 运营的漏洞数据库 OSV.dev 收录了超过 70 万个开源漏洞,再加上 OSS-Fuzz 十多年来积累的结果,可以帮助我们识别质量最高的漏洞。

借助这些资源,我们能够超越合成的网络安全示例,教会模型像真正的安全专业人员一样工作。我们的模型会学习使用行业标准工具、阅读 Chromium 等大型项目中的数百万行代码,并独立处理需要持续数小时进行深度分析的复杂安全任务。

通过使用 3.5 Flash Cyber 为 CodeMender 提供能力,我们正在构建一种能力强大、可规模化且成本可控的架构,帮助更多防御者保护软件安全。

Original source

本文由 AI 翻译整理自 Google DeepMind,原文版权归原作者所有。

阅读英文原文
上一篇
LLM 推理效率控制的三档模式
下一篇
Claude Code 的设计缺陷分析