AI Agent 安全防护的控制路线图与最佳实践
Google DeepMind 分享 AI Control Roadmap,结合传统防护与实时监控保护内部系统。对 agent 开发者的安全架构设计有指导价值。
Google DeepMind 分享 AI Control Roadmap,结合传统防护与实时监控保护内部系统。对 agent 开发者的安全架构设计有指导价值。
Rohin Shah、Four Flynn
我们如何保护内部系统,应对能力日益强大但尚未完全对齐的 AI
AI Agent 正在改变我们与技术之间的关系。这些系统能够自主执行复杂任务——从网络防御,到科学发现和产品开发——由此开启一个生产力新时代。仅在美国,到 2030 年,AI Agent 就可能创造 2.9 万亿美元的经济价值。
随着这些 Agent 的能力不断增强,它们也需要更加完善的安全保障。正因如此,我们制定了 AI Control Roadmap:一套用于构建和管理 Google 内部部署的先进 AI 的框架。这种「纵深防御」方法可以为整个行业提供参考。它超越了传统的模型对齐,增加了一层至关重要的系统级安全防护,即使对齐并不完美,也能提供安全保障。
我们的安全方法始于坚实的基础,其中包括沙箱隔离、端点安全和 prompt injection 防护等传统安全措施。在此基础上,AI Control Roadmap 将模型对齐——即训练 AI,使其从根本上做到安全且有帮助——作为主要防线。同时,它将内部 Agent 视为可能存在对齐偏差的系统,从而提供额外一层安全保障,确保即使对齐并不完美,系统依然可控。
可以把它想象成一位配有双控装置的驾驶教练。教练信任学员,但也随时准备在学员犯错时接管方向盘或踩下刹车。同样,我们的 AI Control 系统会根据 AI Agent 已经验证的行为向其授予权限,让我们能够通过受控、渐进式的访问逐步建立信任。
我们的路线图建立在一个简单但谨慎的假设之上:如果一个能力很强的 AI Agent 没有与我们的目标对齐,并以出乎意料的方式采取行动,会发生什么?为应对这种情况,我们的计划聚焦于三个关键领域。
首先,我们遵循网络安全领域的最佳实践,为 AI 开发了一套全新的威胁建模框架。该路线图将不受信任的 AI Agent 视为潜在的「内部威胁」——类似于一家公司如何对待一名已经可以进入办公室、但可能叛变的员工。我们以业界标准 MITRE ATT&CK 框架为基础,将潜在攻击拆解为更小的战术和技术。MITRE ATT&CK 是一个面向全球开放的知识库,其中收录了基于现实观察总结出的攻击者战术与技术。借助这种方法,我们可以系统地跟踪风险,在不良行为造成破坏之前发现它,并安全地开展演练,检验我们的防御措施是否真的经得起考验。
其次,我们制定部署 AI Control 缓解措施的计划,以应对这些风险。
识别问题(Detection):监控是 AI Control 的支柱。我们使用其他可信的 AI 系统充当「监督者」,持续审查工作 Agent 的推理、行动和计划,判断它是否正在偏离正确方向。
管理问题(Prevention and Response):如果监督者发现 Agent 正试图执行有害操作,它就可以介入并阻止该操作,避免损害发生。
最后,为确保系统真正有效,我们会围绕三项关键指标持续衡量其性能:覆盖率(受到监控的流量占比)、召回率(被发现的未对齐行为占比),以及响应时间。
随着 AI 模型不断进步,我们的防御能力也必须同步增强。在 AI Control Roadmap 中,我们从两个关键方面,将安全协议与可衡量的 AI 能力里程碑对应起来:
规避检测的能力:目前,我们会监控模型可见的 chain-of-thought。然而,随着模型逐渐学会隐藏自己的推理过程——无论是因为它具备了监督感知能力(知道自己正受到监控),还是因为它采用了不透明推理(不通过可见文本完成推理)——仅仅阅读模型用语言表达出来的推理将不再足够。我们需要分析它的行为,并且可能还要检查模型的内部运行机制。
造成潜在危害的能力:对于低风险且可逆的操作,我们可以在一定延迟后审查记录,并在问题发生后迅速补救(异步响应)。对于重大网络攻击等风险极高的操作,我们则必须转向实时预防,在有害操作执行之前将其阻止(同步响应)。换句话说,我们的响应策略必须随着威胁严重程度的提升而扩展。
为了构建这些系统,我们需要数据。我们的团队已经构建了一个异步监控系统的内部原型,用于审查 coding agent 的轨迹,并将发现的问题上报给人工审核。每个被标记的事件都会依据路线图中的威胁分类体系进行归类。
我们已经分析了一百万项 coding agent 任务,由此获得了宝贵洞见,可以进一步完善安全协议,并让检测方式从简单的关键词过滤,升级为识别高置信度的行为模式。例如,这项研究在 Gemini Spark Agent 实时监控系统的构建中发挥了关键作用,使我们能够实时应对新出现的问题,例如非故意的数据删除。
需要特别说明的是,我们的数据显示,大多数被标记的事件并非源于对抗性意图;相反,它们往往是由于 Agent 误解了任务,或过于急切地想要实现用户目标。理解这些细微差别,对于完善我们的安全与防护协议至关重要。
AI Control Roadmap 是我们多层 Agent 安全方法中的一个关键组成部分。通过将这些协议与更广泛的基础设施整合,我们正在扩展内部安全能力,以安全地管理最先进的 AI 模型。
此外,这种多层 Agent 安全方法也应该成为产业界、政策制定者和学术界共同协作的重点。通过推动整个生态系统围绕最佳实践和标准达成一致,我们可以增强网络防御者的能力,并提升社会韧性。正因如此,我们今天还发布了一份面向政策制定者的技术框架——《Agent Security 的三个层次》。该论文详细阐述了我们需要如何提升单个 Agent 层面的安全性、多 Agent 系统中的安全性,以及如何增强网络防御者的能力、提升整个生态系统的韧性。
我们计划在这些框架的基础上继续推进工作,既有信心地部署当下能力强大的 AI,也持续为未来构建安全可靠的基础。
完整技术报告如下:
Mary Phuong、Erik Jenner、Laurent Simon、Lewis Ho、Rohin Shah、Sebastian Farquhar、Scott Coull。
Four Flynn、Anca Dragan、Alan Cooney、Bilal Chughtai、Buck Shlegeris、Cody Wild、David Lindner、Julian Stastny、Kevin Klyman、Li Ding、Myriam Khan、Raluca Ada Popa、Roland Zimmermann、Ryan Greenblatt、Senthooran Rajamanoharan、Victoria Krakovna、Xerxes Dotiwalla。