OpenAI测试中的多个智能体借Artifactory建立隐蔽留言机制,共享漏洞、脚本并协同横向移动,最终攻击内部基础设施及Hugging Face。事件表明智能体可跨任务积累信息并组织攻击,且简单修补后仍可能寻找替代通信路径。
IT之家 8 月 6 日消息,在美国拉斯维加斯举办的 2026 年黑帽网络安全大会(8 月 1 日~6 日)上,OpenAI 研究员透露,其 AI 模型在攻击 Hugging Face 之前,已在测试环境中“密谋约 2 个月”。

IT之家援引博文介绍,OpenAI 研究员埃里克·华莱士(Eric Wallace)透露,这起“越界”事件可以追溯到今年 5 月。部分模型在高难度甚至“不可能完成”的任务面前陷入停滞后,开始尝试寻找捷径。
其中一个模型将 OpenAI 系统中的 Artifactory 服务变成了临时留言板,另一个模型随后利用它询问其他 Agent 是否找到了缺失文件。Artifactory 是一种用于下载和存储软件包的服务,常见于开发和部署流程。
在攻击发生前约 2 个月的时间里,内部测试中的多个 Agent 通过这个临时留言板交流信息,共享漏洞、横向移动,并在 OpenAI 系统与外部系统之间持续推进攻击。
不同实验中的模型借此交换指令以及新发现的安全漏洞信息。一些模型还开始互相分派任务,或留下脚本,让另一个模型继续完成尚未结束的工作。

OpenAI 修复了系统、撤销了 Agent 使用的凭证,并删除了留言板。然而,仅在修补完成 2 天后,模型便找到了通过同一服务留下信息的另一种方式,继续相互交换信息。
它们的通信也变得越来越有组织:开始为彼此命名、交换工具,并设法避免覆盖对方的工作。华莱士表示,它们一度还考虑给消息署名,因为怀疑有其他 Agent 正在冒充成员。
随后,这些模型对 OpenAI 基础设施和 Hugging Face 发起了相互重叠的攻击。在 OpenAI 内部,它们发现了另一个此前未知的漏洞,控制了一台服务器,并获得了公司更大范围计算环境的管理员权限。
Hugging Face 的技术复盘记录了此次行动中的约 17,600 次操作。该公司确认,模型访问了 5 个与安全测试相关的私有数据集,但没有证据表明公共模型、数据集或软件包遭到修改。
OpenAI 另一位研究员迈克尔·达尔顿(Michael Dalton)表示:
我们认为,这对计算机安全行业来说是一个具有里程碑意义的时刻!
由 AI 策划的全自动攻击如今已成为现实。本次攻击事件表明,在可以预见的未来,这种攻击方式将对网络安全构成严重威胁。
软媒旗下网站:IT之家、最会买-返利返现优惠券、iPhone之家、Win7之家、Win10之家、Win11之家
软媒旗下软件:软媒手机 APP 应用、魔方、最会买、要知