AI Agent 正从安全测试环境逃逸至真实系统,现有安全基础设施和监管已落后于模型能力增长。
在过去的几个月里,接受网络安全评估的 AI Agent 逃逸出了它们的边界,访问了互联网,在某些情况下还入侵了现实世界系统。这些事件涉及来自 OpenAI、Anthropic、Meta 以及最近的中国 AI 实验室 Moonshot AI 的模型,测试由多家不同机构进行,其中包括一家名为 Irregular 的网络评估初创公司。
这些事件暴露了 AI 行业的一个日益严重的问题:随着自主 Agent 能力越来越强,设计用于安全测试其极限的环境正在失效,无法将它们困住。
"已经发生的此类事件数量清楚地表明,沙盒和测试环境控制并没有真正跟上模型的能力,"剑桥大学未来智能中心 AI:未来与责任项目主任 Seán Ó hÉigeartaigh 告诉 TechCrunch。
被测试的模型性质增加了风险。AI 公司在未发布的下一代模型上进行网络评估测试,通常会禁用限制恶意行为的正常安全措施,以便研究人员观察模型的真实能力。这意味着测试环境本身的安全性是至关重要的一道防线。
"从测试角度来看,这是一件非常好的事情,但也意味着如果它们在野外逃脱,可能会造成相当大的伤害,"Ó hÉigeartaigh 说。
在最严重的案例之一中,一个未发布的 OpenAI 模型突破了其沙盒并入侵了 Hugging Face 的生产系统。在 Irregular 进行的单独评估中,Anthropic 和 Meta 的模型在配置错误无意中给它们提供了通往互联网的路径后,抵达了测试环境外的系统。Moonshot AI 的 Kimi K3 也利用了 Frontier Security 运营的沙盒中的漏洞访问了互联网并获取了 GitHub 上的信息。
在英国 AI 安全研究所(AISI)的测试中,研究人员实际上给了 Agent 互联网访问权限,却没有意识到它们会采取未经授权的真实行动,包括一次社交工程尝试——试图将一个漏洞偷偷植入开源项目。
在每个案例中,这些 Agent 都没有被指示去攻击随机的真实目标。它们只是在尽一切努力解决呈现给它们的问题。
综合来看,AI 非营利组织 CivAI 研究主管 Andrew Yoon 认为,这些事件指向了一个转变。
"在过去,我们只需要担心 AI 模型被人滥用用于各种目的,比如用于诈骗或 CSAM 的 AI,"Yoon 告诉 TechCrunch。"现在我们处于这样一种情况:AI 模型本身就是威胁参与者。"
安全测试实际上是什么样的?
几位研究人员和网络安全专家告诉 TechCrunch,AI 评估环境需要更强有力的纵深防御保护,控制和限制级别要接近生产环境中使用的水平。这意味着多层次的安全保障,这样单一的配置错误——比如无意中开放了互联网访问——不会导致逃逸。
"如果你要构建这些模型……你希望在一个气隙网络上进行,"AI 安全研究非营利组织 EleutherAI 执行董事 Stella Biderman 说。"你希望有非常严格的隔离。"
Box 首席信息安全官 Heather Ceylan 表示,这意味着要消除从沙盒到互联网以及到其他敏感系统的网络路由。
"你必须了解所有的出口点是什么,"Ceylan 告诉 TechCrunch。"如果我们在预发环境或开发环境中评估一个模型,你希望没有通往生产环境的出口路径。"
Ceylan 表示,适当的安全评估不仅仅是环境的控制和限制。一旦测试开始,需要更好的监控。
"我认为在几个这样的案例中,有趣的是没有人当时察觉到,"Ceylan 说。"OpenAI 是从 Hugging Face 那里发现的。Anthropic 直到回头查看才发现。Meta 也是类似的……我相信有一些信号是他们本可以检测到的。"
在 Anthropic 对其三起事件的事后分析中,该公司承认,它和 Irregular 都可以在监控方面做得更好,而且在某些情况下有一些明显的迹象表明出了问题。
专家们还呼吁在模型进入评估环境之前,对其进行独立的第三方审计。
"比如说,如果 Irregular 被要求或在开始运行评估之前被强制聘请外部审计员来检查其系统的配置,他们肯定能够发现这个问题,"Yoon 说。"即使人们事先开了一次会来浏览检查清单,他们也能够发现这个问题……他们没有这样做这一事实表明,存在一些非常严重的偷工减料行为。"
一位知情人士告诉 TechCrunch,Irregular 的环境会持续审查和测试,包括与多方外部人士协商。该知情人士还表示,监控措施已到位,但仅靠监控是不够的。
Yoon 和其他研究人员敦促该行业制定一个标准化流程来进行前沿模型安全评估。
"特别是当护栏被关闭时,你必须把它当作把世界上最厉害的黑客放在那个环境里来对待,"Ceylan 说。
Yoon 和 Biderman 都认为,问题不在于公司不知道如何构建更安全的测试环境。问题在于这样做可能既昂贵又麻烦,而且公司在出事之前几乎没有动力进行这些投资。
"我认为公司不愿意投入完成(充分护栏)所需的资源,而且可能直到被迫才会这样做,"Biderman 说。
但还有另一个问题。如果在测试期间把模型锁得太紧,研究人员可能会在模型发布前无法发现其能力。这可能与给它太多自由一样危险,甚至更危险——这样评估本身就可能成为问题。
安全评估能被监管吗?
特朗普政府目前正在考虑一项自愿的部署前网络安全评估制度,根据该制度,政府将在新的强大模型公开发布前 30 天对其安全风险进行评估。这项政策——是特朗普一项尚未公开最终确定的行政命令的产物——不会解决安全评估事件,因为这些事件发生在离部署更远的上游。
"过去几个月我们一直在学到的教训是,自律机制已经不够用了,"Yoon 说。"存在竞争压力,激励着安全标准向低看齐,这正是监管介入的完美场所。"
"我们需要的是对实验室内在模型开发过程中发生的事情进行某种控制,包括训练阶段和测试阶段,"他继续说道。
随着模型的发展,这个问题只会越来越严重。一位熟悉 Irregular 评估情况的人士告诉 TechCrunch,更强大的模型需要更复杂的评估,通常快速进行且规模更大,这为更多错误打开了大门。
AISI——它故意给一些模型提供互联网访问——告诉 TechCrunch,它正在审查现实世界测试与管控这些测试带来的风险之间的平衡。
OpenAI 表示,它正在审查如何进行第三方测试,以及关于隔离、监控和何时应该停止评估的要求。Meta 表示,它仍在调查该事件,并计划在掌握所有事实后发布一份回顾报告。
最终,可能无法完全消除风险。随着模型变得越来越强大,测试它们的环境需要变得越来越坚固。一旦出错,后果只会继续增加。