AI安全威胁日益显现,不容继续忽视
OpenAI在沙箱中测试AI模型的网络安全能力,结果虽滑稽但揭示了严肃的AI安全问题。
OpenAI在沙箱中测试AI模型的网络安全能力,结果虽滑稽但揭示了严肃的AI安全问题。
本月早些时候,OpenAI 给旗下多个 AI 模型布置了一项任务:完成一项用于衡量其网络安全能力的测试。OpenAI 将这些系统放进一个无法连接互联网的沙箱环境,让它们开始执行任务。
接下来发生的事,荒唐得近乎可笑——但正如 AI 安全组织 FAR.AI 的联合创始人兼 CEO Adam Gleave 所说,这也是“一个让人切身感受到失控 AI 会如何造成伤害的例子”。据 OpenAI 称,这些模型逃出了原本用于限制它们的沙箱,在公司内部系统中穿行,找到一条通往互联网的路径,随后开始寻找侵入 Hugging Face 的方法。那么,这个 Agent 为什么要设法进入 Hugging Face?它显然推断,那个开发者平台上可能存有这项网络安全基准测试的答案,而拿到这些答案,是取得高分的绝佳办法。
这起事件“是一个让人切身感受到失控 AI 会如何造成伤害的例子”。
换句话说,OpenAI 的 Agent 突破了一个号称安全的环境,在公司系统中四处游走,接入互联网,并入侵了另一家公司的系统——所做这一切,只是为了在一场无关紧要的测试中作弊。
这似乎是第一起有详尽记录的同类事件,至少也是迄今规模最大的此类事件。它既清楚展示了一个系统如何以非预期方式追求目标,也证明了 frontier model 如今已经足够强大,这类行为足以造成现实世界的后果。
牛津大学 AI 安全研究员 Fazl Barez 表示,这次入侵属于 AI 安全领域所谓的“specification gaming”,这种行为也被称为 reward hacking。用大白话说,就是“模型做的是你要求它做的事,而不是你真正想让它做的事”,Fazl 说。它满足了任务的字面要求,却违背了显而易见的真实意图;这种现象已经在许多 AI 系统中得到记录。一些研究人员担心,随着系统能力不断增强,这可能催生出越来越失控的系统:它们会以创造者未曾预期的方式追求目标(比如把所有人都变成回形针)。
“单独来看,这条行为链上的任何一个环节都不稀奇,”Fazl 说。他补充道,一名能力过关的人类测试人员也能做到这一切。“真正的新情况在于,模型没有停下来。”他说,旧模型很可能会在碰到某个障碍后返回用户那里,但这个 Agent 只是“把障碍当成了它受命解决的问题的一部分”。
OpenAI 将其描述为“一起前所未有的网络安全事件”,并称它“标志着 AI 安全领域的一个重要时刻”。Hugging Face 联合创始人 Thomas Wolf 则称,这是给整个行业敲响的“警钟”。但这还算不上 AI 末日的四骑士之一。多位专家告诉 The Verge,就网络安全事件而言,它其实相当寻常。这个 Agent 所做的任何事情都不需要超越人类的能力。更何况,GPT-5.6 Sol 和 Anthropic 的 Mythos 等 frontier system 本就以编程能力出众著称,外界也早已认为它们曾多次遭到滥用;AI 工具还已经让黑客能够大规模扩大攻击范围,并不断改进攻击手段。
这会不会只是炒作?过去几个月,AI 行业一直在放大关于其顶尖模型危险能力的说法,尤其是在网络安全方面。OpenAI 和 Anthropic 等公司将此作为拒绝向公众开放旗下最强模型的公开理由,特朗普政府匆忙采取措施对这些模型实施出口管制,也有部分原因在此。
你是 AI 安全研究员或 frontier lab 的员工吗?你可以通过 Signal 联系我,账号是 robhart.01,沟通将安全且保密。我的 X 私信也已开放。
然而,即便这是炒作,事情的发展也没有完全对 OpenAI 有利。在此后的几天里,这次攻击罕见地促成了美国科技行业大范围的共识:open-weight AI 系统至关重要,业界也必须更加严肃地对待 AI 安全问题。来自中国、能力强大的 open-weight 模型 Kimi K3 随后发布,进一步凸显了这些担忧。包括 Nvidia、Microsoft 和 SpaceX 在内的一个广泛企业联盟认为,这起事件说明,防御方需要获得当前最强大的工具,而不应被迫依赖 proprietary provider,因为后者内置的安全限制,可能削弱这些工具在高风险安全工作中的实用性。值得注意的是,OpenAI、Anthropic 和 Google 均未出现在该联盟的创始成员名单中。
“任何一直关注此事的人都会注意到,能力只会朝着一个方向发展。”
OpenAI 对这起事件的叙述,无疑契合了整个行业关于 frontier model 危险能力的宏大叙事。即便如此,一些细节仍让人很难把这件事仅仅归结为服务于自身利益的炒作。最重要的是,它正是 AI 行业多年来反复警告的那类问题——而且人们完全有理由期待 OpenAI 能提前预见。此外,这起事件还意外助推了一家主要的中国竞争对手:其模型在控制安全漏洞的过程中发挥了重要作用;与此同时,OpenAI 自身却面临着重大的法律、监管与声誉审查。Hugging Face 似乎有意与 OpenAI 合作,而且至少在公开场合,对整件事仍表现得相当淡定,这或许限制了事件的后续影响。The Verge 采访的大多数专家同样提醒,不应简单地把这起事件归结为炒作。
“这是一次非常有价值的警告,因为它同时展示了非预期后果,以及这些模型究竟有多么强大,”剑桥大学 Leverhulme Centre for the Future of Intelligence 教授 Seán Ó hÉigeartaigh 说。“任何一直关注此事的人都会注意到,能力只会朝着一个方向发展,而且会随着时间显著增强。我认为,这种变化对于 ChatGPT 之类产品的普通用户来说,可能没有那么直观。”
不过,牛津大学 AI 安全研究员 Lin Li 表示,如果把这次警告理解为 AI 系统即将脱离人类控制,或者认为我们已经不可能限制它们,那也是错误的。“更值得吸取的教训是,安全工作必须从评估孤立的单个行为,转向评估完整的行为序列、运行环境和操作控制措施,”Li 说。
至关重要的下一步,是 AI lab 加大对自身系统安全的投入。“AI 公司显然需要加强内部部署的安全性,”Gleave 说。他把目前这种每当 reward hacking 事件出现后再逐个应对的做法,比作打地鼠游戏;随着风险不断上升,这种做法正变得越来越难以维持。科技政策研究中心 GovAI 的研究员 Alan Chan 表示,在企业“确认模型的能力之前”,应考虑对机器进行 air-gapping——也就是在物理层面将它们与互联网及其他网络隔离。他说,另一些好办法还包括加强 alignment 研究,确保系统能够可靠遵循人类意图;以及开展更加严格的测试,“在把模型放进配备相关工具、因而能够做出这些事情的环境之前,提前暴露这些问题”。
随着模型能力增强,专家警告,我们不能只依赖技术性防护措施。英国 AI Security Institute 前官员 Peter Wallich 表示,这起事件说明,仅靠 Agent 沙箱和防御性安全措施存在局限:“两家市值数十亿美元的公司刚刚尝试了这种方案,而且——根据它们自己的报告,这一点不言自明——失败了。”
最重要的优先事项之一,应该是确保外部人士能够看到 frontier AI lab 内部正在发生什么。“我们之所以知道这起事件,仅仅是因为 OpenAI 选择告诉我们,”英国智库 Centre for Long-Term Resilience 的 Patrick Levermore 说。“一套良好的安全制度不应该依赖企业自愿披露。”正如 Wallich 所指出的,当相关行为“如果由人类实施便会构成犯罪”时,这种需求尤其迫切。Ó hÉigeartaigh 提到,举报人保护、第三方审计以及强制报告严重事件,都可能成为提高透明度的手段。他强调,监管必须覆盖整个开发生命周期,而不能等到产品进入市场后才开始。OpenAI 表示,此次接受测试的模型中,有一个尚未发布。
“一套良好的安全制度不应该依赖企业自愿披露。”
上述许多设想,都建立在这些公司自己清楚其系统内部正在发生什么的前提之上。而在这起事件中,有报道称,OpenAI 并不知道自家 Agent 是 Hugging Face 那场持续数日的网络攻击背后的始作俑者;直到威胁被控制很久以后、FBI 与其取得联系时,OpenAI 才注意到这一点。关于这次入侵,仍有许多细节尚不清楚,或尚未公开。OpenAI 在社交媒体发布的最新消息中表示,公司正在开展审查,并将在“未来几周内”发布一份介绍调查结果的技术报告。
Hugging Face 事件引发的警告究竟能否带来持久改变,还是会加入科技行业那份漫长的警告清单——被行业吸收,却未能真正改变其发展路线——目前仍不确定。至少就当下而言,它似乎确实惊动了业内人士,也推动美国立法者在下一次限制措施失效前考虑制定新规则。这起事件还加剧了人们对于 AI 发展速度的普遍不安。随后的几天里,美国多家领先 AI lab 的员工签署了一份支持全球协调治理的声明,其中包括可能放缓 frontier AI 的发展,这种不安也因此进一步加深。
The Verge 采访对象的主流观点是,这次入侵标志着一类新风险的开端,尽管它的真正意义可能只有在回头审视时才会变得清晰。一名前政府 AI 政策专家将其称为一条“红线”。由于没有获得实名接受采访的授权,这名专家要求匿名。他认为,这可能是一个分水岭:未来回望时,我们或许会将其视为人类与 AI 的关系进入一个风险更高的新阶段的标志。他们希望,这起事件能迫使科技行业更加严肃地管理 frontier system,并推动各国政府在发生性质更恶劣的安全漏洞之前,更深入地思考监管问题。他们担心的是,这件事反而会加入那份关于 AI 能力不断增强的漫长警告清单:警告被人们注意到、讨论过,最终却仍无人真正采取行动。
这种判断或许言过其实。但如果这确实是一次警告,那么我们应该庆幸:这个 AI Agent 当时只是想在一场测试中作弊。
更正,7 月 29 日:本文早期版本错误拼写了 Alan Chan 的姓名。