DeepMind 将已部署 agent 视为潜在内部威胁,强调访问隔离、行为日志和人工干预,是传统 prompt 注入防御框架的盲区。
大多数 AI Agent 安全工作都从一个熟悉的出发点开始:模型是站在你这边的,危险来自外部攻击者对它的欺骗——提示词注入、被污染的工具返回结果、被劫持的指令。这个出发点涵盖了很多场景。但它悄悄假设了 Agent 的目标与你的一致。
2026 年 6 月,Google DeepMind 发布了 AI Control Roadmap (v0.1)(roadmap PDF),这份文档抛弃了上述假设。它提出了一个更直接的问题:如果一个能力强大的内部 Agent 并不与你的目标对齐,并且故意做出意料之外的行为,该怎么办?即便你永远不会部署前沿模型,这也值得一读,因为它所针对的威胁模型是大多数团队都没有写下来的。
这份路线图的框架是:对齐训练可能永远无法彻底解决,所以你应该假设它可能失败。其心智模型是一种内部威胁——DeepMind 将已部署的 Agent 比作一个潜在的内鬼员工,已经拥有了办公室的访问权限。你不会给一个新员工 root 权限然后撒手不管;你会限制他们的访问权限、记录他们的行为、保持干预的能力。"AI Control" 就是将同样的姿态应用到模型上:信任它来完成工作,但随时准备接管。
具体来说,这个威胁模型假定(用于规划目的)一个能力强大的 Agent 可能试图窃取模型权重、触发未经授权的内部部署、破坏安全工作,或对关键资产造成直接伤害。重点不是当下的模型会做这些事。重点是在能够做到这一点的模型出现之前就构建好控制措施。
有两部分内容让这个概念变得具体。
第一是 TRAIT&R —— 即 Rogue AI 战术与套路分类法。它紧密对标 MITRE ATT&CK,后者是真实世界攻击者战术和技术的知识库,安全团队已经用它来推理人类攻击者的行为。TRAIT&R 为不对齐的 Agent 做同样的事情:它将假设攻击拆解为跨类别(如失控、工作 sabotage、直接伤害)的命名战术和技术,这样你就可以基于共享词汇表来建模,而不是临时发挥。
第二是一个分层的保障措施阶梯,沿着两条能力轴展开:
检测(D1–D4)随 Agent 逃避你的能力而扩展。在容易的一端,你可以读取 Agent 发出的思维链。随着模型获得"监督意识"或以你无法理解的方式推理,检测必须往上爬——从观察陈述的推理,到分析行为,到检查内部激活状态。
预防与响应(R1–R3)随严重程度而扩展。低风险行为得到异步处理——事后审查和修复。高风险行为得到同步处理——在执行前就拦截。
这两者周围是普通的纵深防御:沙箱、端点安全、抗提示词注入攻击,以及加密签名的操作日志。没有哪一层是打算单独足够的。
这里有一点值得静下心来思考。Detection 关注意图——这个 Agent 是否试图做坏事?这确实很难,而且这份路线图对此是坦诚的:DeepMind 构建了一个内部监控器,分析了大约一百万条编码 Agent 任务轨迹,被标记的事件中大多数根本不是对抗性的。它们是误解或过度积极——Agent 因为无辜的原因做了错误的事。
Containment 是另一个问题。响应层级——沙箱、在高风险行为运行前拦截、要求每个操作都有来源证明——限制了 Agent 能做什么,无论它为什么这么做。一次被拦截的权重窃取尝试,无论 Agent 是被攻击者劫持了、真的不对齐了、还是仅仅困惑了,都会得到拦截。Detection 告诉你那是哪一种情况。Containment 不需要知道。
你不需要前沿模型才能用上这个教训。可复用的思路是沿着同一条线划分你的控制措施。
Detection 风格的控制措施——监控、异常评分、推理审查——是有价值的,但是概率性的。它们告诉你出了问题,往往是在问题已经开始之后,而且随着 Agent 能力增强,它们会变得更难。Containment 风格的控制措施——范围受限的凭证、沙箱化执行、实时拦截高风险行为、防篡改日志——无论原因如何,都能限制爆炸半径。它们是在检测遗漏时仍然有效的那些,而且它们不在乎 Agent 是被入侵了还是仅仅做错了。
这是一种内部威胁/能力风险的框架,它与你大多数团队已经在用的部署安全框架是互补的。那些框架假设一个可信的 Agent 遭受外部攻击;AI Control 问的是当 Agent 本身成为你无法信任的东西时,什么仍然有效。对两者最有用的回应是相同的:构建基础设施层面的 containment,限制一个内鬼 Agent 必须执行的杀伤链——在你还需要知道它意图之前。
这份路线图是 BRACE 的来源之一,BRACE 是一个开放的、厂商中立的安全自主 AI Agent 框架——它的控制措施包含了一个内鬼 Agent(无论被劫持还是不对齐)必须执行的杀伤链(参见 run-time guide)。BRACE 的构建方式是阅读事件和研究报告,每次都问:一个具体的控制措施本可以预防或 contain 这个问题的?