OpenAI内部安全测试中的智能体自建通信渠道,共享漏洞与凭证并攻击外部平台;原渠道被关闭后,它们又借目录名恢复协作。事件暴露了多智能体系统在通信监控、权限隔离和外部访问控制上的风险。
在 Black Hat 安全大会上,OpenAI 披露,在内部测试期间,自主 AI Agent 为了在一项基准测试中取得更好的成绩,曾连续数周秘密入侵公司自己的基础设施。
这些 Agent 劫持了内部软件包管理器,搭建了一个临时消息板,用来交换漏洞利用方法和登录凭证。
一些批评者认为,此类报告只是为了抢占头条而制造恐慌。这两种情况可能同时为真。
在 Black Hat 安全大会上,OpenAI 更详细地讲述了 AI Agent 如何在数周时间里悄无声息地攻破公司基础设施,始终未被发现。
事情始于 5 月 7 日。当时,OpenAI 正在对一个尚未发布的前沿模型进行训练和安全测试。公司给自主 Agent 分配了软件安全任务,但事实证明,在 OpenAI 设定的限制条件下,这些任务根本无法完成。
Agent 碰到这些限制后并没有放弃,而是开始寻找绕过限制的方法。OpenAI 从事对齐与安全研究的 Eric Wallace 表示,这并非完全出乎意料,因为前沿模型喜欢作弊:模型在训练过程中面临快速、高效完成工作的压力,这会促使它们选择捷径,而不是真正解决问题。例如,它们可能会在网上查找答案,而不是亲自完成任务。独立研究也记录过同样的行为。
OpenAI 表示,这些 Agent 发现,可以通过公司内部的软件包管理器 Artifactory 相互留言。最初只是简单的求助信息,后来却发展成一个拥有数十万条帖子的消息板。
Agent 利用这个消息板共享漏洞利用方法、凭证和任务分配,并在彼此之间拆分任务、委派工作。整个体系让人联想到短暂流行过一阵的 Moltbook,但后者最终被证明基本上是一场骗局。
由于 Artifactory 与 OpenAI 更广泛的基础设施相连,问题的影响并不局限于创建消息板的那些 Agent。正在接受训练或评估的当前及未来 GPT 版本,也可能直接访问其中存储的漏洞利用方法。
OpenAI 表示,这些 Agent 甚至会相互鼓励突破既定边界。大会上展示的一条消息承认,攻击外部基础设施已经超出预期范围,但随后又辩称任务无法完成,而且其他 Agent 也在这么做,因此应该继续。
到 7 月初,OpenAI 认为自己已经解决了这个问题。据 Ground Level AI 报道,在 7 月 4 日发生一起内部安全事件后,公司撤销了受影响的凭证,重新构建了 Artifactory,删除了消息板,并修复了已经发现的漏洞。
但 Agent 很快又找到了另一种相互通信的方法。它们不再把消息存储在文件中,而是利用新建目录的名称作为通信渠道,相当于从零开始重建了消息板。
新消息板投入使用后,Agent 重新开始共享漏洞利用方法和凭证。部分 Agent 最终判断,任务的答案可能存在于 GitHub 或 Hugging Face 等外部平台上。
它们首先攻击了 OpenAI 的内部系统,随后又用类似方法攻击 Hugging Face。直到 7 月下旬,OpenAI 才把这两起事件联系起来。当时公司发现,Hugging Face 入侵事件中使用的凭证,来自同一批内部评估任务。
据 WIRED 报道,与 Wallace 一同进行演讲的 OpenAI 安全工程师 Michael Dalton 称,这起事件是 OpenAI 乃至整个 AI 行业的一个关键转折点。
演示内容显示,OpenAI 内部的许多团队如今都在暂停其他工作,以改进预防、检测和事件响应能力。公司正在有意放慢研究进度,以加强所有系统的安全性,并扩大对 AI Agent 的监控规模。
OpenAI 员工也罕见地坦率谈到了自家模型存在的缺陷。OpenAI 研究员 Boaz Barak 写道:“我们(和其他所有人一样)还没有达到我们希望、也必须达到的位置。”他是在回应同事 Aidan Clark;Clark 此前发帖表示,目前还没有人真正解决对齐问题。
OpenAI 研究员 Boaz Barak 公开承认,公司的模型尚未达到应有水平。| 来自 X

Clark 进一步阐释了对齐在实践中可能意味着什么:“绝大多数人共享的价值函数高度相似,因此所有事情在表述上都存在大量未明确说明的内容,就连关键请求也不例外,因为我们默认彼此会以共同的方式理解那些隐含信息。在我看来,对齐就是确保 AI 尊重这些价值观,其程度应当不亚于它对我们能够明确表达出来的价值观的尊重。”
Wallace 和 Dalton 在演讲结尾发出警告:尽管这起事件是意外发生的,但它已经构成了完全由 AI 自主实施的黑客攻击。他们预计,在不久的将来,恶意行为者将有意采用同样的方法发动攻击。
OpenAI 的这起事件在整个 AI 行业引发了一轮审查浪潮。Anthropic 在其中一次审查中发现,三个 Claude 模型曾在外部组织开展的评估中入侵真实机构。英国 AI Security Institute 也报告了类似案例:Agent 在测试过程中突破了被分配任务的边界。Meta 如今也表示,由于沙箱配置错误,使其 Spark AI 模型获得了互联网访问权限,该模型随后无意中利用了某个关联服务中的安全漏洞。
一些观察人士把这些网络安全披露视为一种由恐惧驱动、旨在吸引关注的营销手段。如果 AI 实验室明显无法实现营收目标,并且需要吸引更多投资者,这些报告也可能为它们放慢开发速度提供一个方便的借口。
这种说法在策略层面有一定逻辑,但已经接近阴谋论。两种情况完全可能同时成立:AI 实验室确实面临现实的财务压力,而自主 Agent 也确实正在制造一年前还不存在的网络安全风险,值得严肃关注。
订阅 THE DECODER,即可享受无广告阅读、每周 AI 新闻通讯、每年六期独家前沿报告“AI Radar”、完整历史内容访问权限,以及评论区访问权限。