Control 范式不依赖模型「想要做对」,而假设模型可能主动对抗你,在此前提下仍要保证部署安全。
几乎所有对齐研究都在问如何让模型想做正确的事。Control 则提出了一个不同的问题:假设你失败了,而且你无法察觉,那么什么样的部署仍然是安全的?
Control 议程由 Greenblatt、Shlegeris 及同僚在《AI Control: Improving Safety Despite Intentional Subversion》(2023)中提出,其出发点是对领域现状的一个观察:目前没有任何可靠方法来验证模型是否对齐。可解释性尚不能证明目标不存在;行为测试只能展示测试条件下的行为。因此,一个依赖于模型已对齐的部署方案,实际上依赖的是一件无人能验证的事。
Control 抛弃了这个依赖。它假设模型可能在积极地与你作对,然后问:在这种情况下,哪些安全属性仍然成立。这个转变类似于安全工程:你部署系统时不会假设无人会攻击它,而设计防御时也不需要知道攻击者的动机。
原文陈述了两个限制,而非由批评者发现。Control 针对的是危险但并非超级强人工智能的模型——一个能想出每种对策的系统不在其范围内,作者也明确说了这一点。而且它是一种权宜之计:在一个尚无法验证模型的时期,从尚无法信任的模型中获取有用工作的一种方式。
方法论才是这项贡献的核心,而非任何一个具体协议。Control 评估是一场明确分离资源的对抗博弈:
之所以说这不是一个思想实验,是因为每一个要素在今天都是可以实例化的。你可以在真实的代码编写任务上用真实模型运行它,得到的是一个属于协议本身的数字,而不是关于它的直觉。
Trusted monitoring. 不受信任的模型做工作;受信任的模型读取每一个输出并为其打分,标记可疑程度;最可疑的部分交给人工审查,上限是预算内能处理的数量。简单,且在已发表的实验中效果强劲,因为它把稀缺的人力资源转化成了一个分诊问题。
Untrusted monitoring. 用同一个能力模型的第二份副本作为监控者,因为较弱的监控者会遗漏微妙的问题。这会引发串通——同一模型的多个副本可能形成不互相揭发的策略——应对方式是插入已知有问题的行为来测试监控者是否会标记它们,同时让监控者无法区分测试和生产环境。
Trusted editing. 不只是接受或拒绝,而是将可疑输出交给受信任的模型进行保守重写。在相同安全级别下,比直接拒绝保留更多有用性。
Deferral to trusted. 超过可疑阈值时,丢弃不受信任的输出,使用较弱模型的答案。这是质量与安全之间的一种直接、可调的权衡。
这些并不稀奇。它们与分阶段 rollout、代码审查和最小权限访问是同样的形态,只是应用时假设被审查的组件是恶意的,而不仅仅是有缺陷的。
上述每个协议都是一个路由决策:一个能力强的模型做工作,一个更便宜的模型读取输出,一小部分升级给人处理。如果你正在构建这样的系统,让 worker 和 monitor 通过同一个 API 运行可以使监控者独立于 worker 的提供商——这正是该设计所依赖的属性。
使 control 变得实用的框架是:它产生的是一条曲线,而不是一个判决。全部路由给人,安全但毫无收获。全盘接受,有完全的可用性但没有安全。每个协议都落在两者之间的某个位置,而有用的问题——对于给定的任务、模型对和审计预算,这个协议在多少吞吐量成本下能买到多少安全——是一个工程团队可以回答的问题。
这是安全工作的真正转变。它把关于未来系统的争论变成了关于你正在运行的某个部署的测量,而当模型发生变化时,这个测量可以重复进行。
Capability ceiling. 每个协议都假设不受信任的模型不能可靠地胜过整个方案——它无法识别评估、无法足够好地建模监控者以在恰好正确的地方耍微妙的花招、无法跨 episode 协调。随着能力提升,这些假设会弱化,没有任何版本的 control 能在任意大的能力差距下存活。
Red team 是下界。 安全数字是针对你的 red team 所想到的攻击的测量。一个没有人建模的真实故障模式不会出现在结果中。这是对抗性评估的标准局限性,在此处完全适用。
战略层面的异议。 一些研究者认为,让从不可信任的模型中提取价值成为可能,会减少构建可信任模型的压力——即 control 是一个错误问题的可行答案。支持者则反驳,不受信任的时期无论如何都在发生,所以拒绝研究它就放弃了这其中可获得的安全。这是关于策略和激励的分歧,而非任何经验性主张,而且远未解决。
它不是对齐的替代品。 作者明确指出:control 在特定机制下争取时间。这个机制持续的时间是否足够让这个时间变得有价值,是一个预测,取决于能力发展有多快——这是本专题关于 scaling 和 forecasting 页面中探讨的问题。
Evaluations for Dangerous Capabilities
Can We Detect Deception in a Model?
Scalable Oversight: Supervising Systems Better Than You