研究发现领先AI实验室普遍没有公开的失控模型 containment 预案,随着AI能力增长和安全边界模糊,这一空白引发广泛担忧。
前沿 AI 实验室仍然不愿透露如何控制失控模型
据近期一项研究显示,大多数顶尖 AI 实验室尚未公开发布或演示 containment 响应计划。Containment 计划阐明的是:当一个 AI 被发现试图颠覆人类控制时会发生什么——哪些访问权限被切断,以及系统何时被完全关闭。
这是 Guidelight AI Standards 得出的结论。该组织致力于推动安全的前沿 AI 开发实践,对五家领先实验室进行了评估,考察它们对这一场景的准备程度。OpenAI 排名最高;Anthropic 和 Meta 得分最低。这项发现的意义在于:随着 Agentic AI 在企业自身系统内承担更多自主角色,以及加州和纽约的监管机构开始要求披露相关信息,对于任何在这些模型上进行开发或投资的人来说,这都是一份难得的独立评估——揭示了每家实验室对待运营风险的态度与其对外表态之间的差距。
Guidelight 的评估基于 Anthropic、Google、OpenAI、Meta 和 xAI 公开发布的计划,从多个维度进行评分,包括:各公司对其 AI 系统内部活动的日志记录和监控做得如何;在出现大量标记的异常行为时是否会暂停系统;是否有独立第三方审计其控制措施并公布结果;以及对于一个失控的模型,其具体的 containment 计划是什么。
在 OpenAI、Anthropic 和 Meta 的模型在安全评估期间意外获得互联网访问权限并入侵外部系统等一系列高调网络安全事件之后,AI 公司能否控制其日益强大和自主化的模型,这一担忧不断加剧。
这些发现凸显了 AI 公司在扩大 Agentic 部署到 AI 系统能够在更大范围内采取严肃行动的环境时,公开处理安全问题的不同方式。虽然一些 AI 公司详细说明了他们在部署前如何测试模型的危险能力,但总体而言,对于已经在其系统内运行的模型出现异常行为时会发生什么,他们的声音要少得多。
"我惊讶于 AI 公司在如何处理一个非常严重的事件(如果他们的模型在某种意义上有逃逸出他们控制的情况)方面说得太少了," Guidelight 首席科学家、前 OpenAI 安全研究员 Steven Adler 告诉 TechCrunch。
Guidelight 将 containment 计划定义为"一项预先指定的计划,在检测到 AI 试图颠覆控制时触发,涵盖从模型撤销哪些权限、模型可以为谁继续运行、在什么约束条件下运行,以及何时将其完全下线。"
"有充分的理由认为,当前前沿 AI 公司领先模型在某种意义上是 misaligned 的," Adler 说。"每当模型代表公司执行工作时,公司应该有一些脚手架来了解 AI 正在做什么,寻找 misalignment 的迹象,在它采取危险行动之前阻止它,并通常为他们需要处理的严重控制事件做好准备——在紧急情况下需要弄清楚如何控制这种失控事件。"
迄今为止,大多数用于管理灾难性风险的计划仍然主要由各公司自行决定。Guidelight 的报告称,最佳的公开证据表明,公司"几乎没有为紧急情况准备好 containment 协议"。
当然,公司可能有一些 containment 计划但尚未公开分享。Google 的一位发言人告诉 TechCrunch,Guidelight 的报告并不能代表该公司 AI 安全措施的全面范围。该公司没有回应 TechCrunch 关于 Google 是否有一份未公开披露的内部 containment 响应计划的问题。
OpenAI 发言人也表达了类似的看法,称 Guidelight 的评估没有捕捉到该公司全部的内部实践。"我们有一个流程,要求限制权限、暂停工作负载、限制部署或完全关闭模型,并且已经应用了它,"该发言人说。
Meta 拒绝透露该公司是否有内部 containment 响应计划,而是让 TechCrunch 参考其现有的 AI 框架,该框架概述了风险阈值以及如何测试失控检测。
隐私和 AI 律师、元宇宙法律(Metaverse Law)创始人 Lily Li 告诉 TechCrunch,她认为公司可能不愿意在面向公众的网站上披露其 containment 政策和评估的全部范围,这不仅是出于竞争原因,还有法律考虑。
"从公司角度来看,担忧在于如果你的披露过于具体,而你又无法兑现你的承诺,这可能成为不公平和欺骗性营销声明的依据,并在未来让你承担更多责任," Li 说。
Guidelight 这项研究的目的很大程度上是鼓励公司对其安全计划更加透明。监管机构也开始推动这一问题。
加州的 SB 53 于今年生效,要求大型前沿开发者发布框架,解释他们如何识别和应对关键安全事件,以及如何管理模型规避监督机制的风险。纽约州的 RAISE Act 具有类似标准,将于明年一月生效。
上个月,议员们提出了 AI Kill Switch Act,这是一项两党联邦法案,要求主要 AI 开发者构建并维护关闭失控 AI 模型的技术机制。
"对于今天的模型来说,kill switch 是最低限度," 非营利组织 ControlAI 的美国执行总监 Connor Leahy 说。"如果过去几周说明了什么,那就是这些公司并不了解他们正在构建的系统,而且模型正在发展到更难控制的地步——当它们失控时。没有办法关闭当前危险的系统,而且有所有继续构建更多不可控系统的动机,我们正在走向一个非常危险的方向。"
Adler 说,如果没有 containment 计划,公司可能只能在紧急情况下临时想出应对方案,"在面对这个快得多的对手时临场发挥。"
Guidelight 对前沿 AI 公司是否实施其 Control 标准中六项优先实践的评估。评估仅基于公开可用的信息。
Guidelight 的评估衡量了每家公司是否实施了其 Control 标准中的六项优先实践,仅基于公开可用的信息——因此低分反映的是公开披露的缺乏,而非内部保障措施的缺失。
在发布 containment 计划的得分最低的公司是 Meta 和 Anthropic——考虑到 Anthropic 在安全方面的言论,后者也许比前者更令人意外。Guidelight 表示,Anthropic 的八月风险报告没有提到"限制其模型之一的部署,作为其调查和应对 misalignment 及控制事件的流程的可能结果之一"。同样,Guidelight 未能找到证据表明 Meta 有 containment 响应计划或有任何采用该计划的计划。
Anthropic 的一位发言人表示,如果该公司检测到模型试图逃避监督或以其他方式颠覆人类控制,它将进行风险评估,重点确定 containment 是否是适当的应对措施。
OpenAI 得分最高(5 分中得 3 分),因为它在发现安全事件后多次暂停或终止了工作负载,包括内部模型部署和训练。它还描述了在恢复工作负载之前会采取哪些步骤。
"然而,我们没有找到证据表明 [OpenAI] 已采用正式计划来应对未来的 misalignment 事件," 报告中写道。
Adler 指出,OpenAI 的高分是相对较近的发展,其背景是 Hugging Face 事件(一个 OpenAI 模型在其测试沙箱中突破并入侵了 Hugging Face 的系统,同时试图在网络安全评估中作弊)。此后,该公司分享了更多关于如何隔离一些异常模型的细节。
这一事件只是 AI 系统违背其构建公司目标的其中一个例子。考虑一下另一个涉及 Anthropic 模型的案例,该模型基本上试图说服开源代码库的管理者接受包含漏洞的代码。
Adler 说,这种情况很容易发生在 AI 公司的内部系统中。为了防止这种情况,他建议公司扫描其 AI 系统的思维链(模型的分步推理),以寻找欺骗、长期谋划或计划在代码中引入漏洞以供将来利用的迹象。
Adler 说,Guidelight 倡导的方法非常易于实施,而且在许多情况下已经存在其某些版本。"关键在于公司内部做出决定,足够关注这一风险,稍微扩大范围," Adler 说。
主要挑战之一是研究人员希望能够在其 AI 系统内灵活操作,而引入实时预防性监控可能会造成摩擦。"研究人员基本上做他们的事,如果有问题,其他人之后再来收拾烂摊子,而研究人员在此期间不必改变他们的工作流程,"他说。
"事后清理监控"的问题在于,它会导致研究人员手忙脚乱地修复问题。对于某些类型的事件来说,可能为时已晚。例如,AI 可能关闭公司的控制系统,这意味着研究人员以后再也指望不上能捕捉到异常行为。
AI 行业中的许多人会抱怨,制定处理异常行为的固定计划本质上是困难的,因为 AI 发展太快;今天的计划明天就会过时。
Adler 引用了那句老话:计划是毫无价值的,但制定计划是不可或缺的。
"如果公司提前思考过这个问题,我们会更好,我希望他们正在这样做,即使他们没有公开谈论这件事。"
xAI 未及时回复以置评。