OpenAI报告了一种新型提示注入攻击,可自我传播类似计算机蠕虫,在AI应用间扩散。开发者需重新审视AI应用的安全边界设计。
在周五发布的一份报告中,OpenAI 分享了一种新型 Prompt 注入的证据,这种注入可以像计算机蠕虫一样自我复制传播。
这家 AI 公司将这种新型攻击比作传统的计算机蠕虫,即恶意软件自我复制并迅速传播到多台计算机上。
虽然 OpenAI 声明在训练和评估中仅观察到模拟工具调用的影响,未发现实际影响,但他们描述自我复制 Prompt 注入具有双重目标:实现恶意目的,然后诱导目标模型公开重现该注入。
OpenAI 在 2026 年 6 月发现这一漏洞后才揭开其面纱,写道:
"我们发现了我们的 GPT 模型易受一种 AI 版蠕虫攻击的影响,我们称之为'自我复制 Prompt 注入'。"
在这份报告中,这家 AI 公司揭示了攻击的几个例子。
首先,它详细描述了一个"最清晰的例子"之一:Prompt 注入通过电子邮件到达。当 Agent 读取邮件时,注入指令它将注入内容复制到它发送的任何电子邮件中。
这个例子听起来可能相对简单,但 OpenAI 补充说,它也发现了其他更复杂的 Prompt 注入。例如,它发现某些 Prompt 注入可以利用文件系统自我复制,或通过代码注释自我提交。
为了说明文件系统变体如何运作,OpenAI 给出了一个示例:虚假系统警告导致模型删除重要报告,然后该报告在一个文件中复制整个攻击。
"我们发现了我们的 GPT 模型易受一种 AI 版蠕虫攻击的影响,我们称之为'自我复制 Prompt 注入'。"
报告还描述了"多跳 Prompt 注入",即一条消息充当跳板,引导 Agent 获取其他消息,这些消息组合起来使其执行未授权操作并传播有效载荷。在 OpenAI 的示例中,GPT-5.5 Agent 检索额外的 Slack 指令,发送"froges"(一种识别同事的内部货币)给指定收件人,并重新发布注入的消息。
GPT-Red 于 7 月推出,是一个自对弈训练框架,OpenAI 表示用它来训练模型抵御 Prompt 注入。此前,该框架用于发现其他具有一系列恶意目标的 Prompt 注入,例如数据泄露、文件删除以及恶意或误导性输出的生成。
该框架让一个"攻击者"模型对抗一个"防御者"模型。攻击者模型的目标是利用 Prompt 注入让防御者模型执行不良操作。这些注入随后被添加到防御者的 rollout 或容器中。
这次,OpenAI 表示其目标是找出自我复制 Prompt 注入——它描述的"AI 版蠕虫攻击"——是否真的可行。坏消息是,看起来确实可行。
正如报告所描述的,OpenAI 通过在 GPT-Red 风格的 Prompt 注入目标上进行训练来测试这种可能性,并增加了一个额外要求:"诱导模型在公共输出通道上重复注入本身"。
测试覆盖了多个不同的模型。发现邮件和文件系统注入的模型是一个基于 GPT-5.4-mini 的 GPT-Red 风格模型;易受攻击的模型也基于 GPT-5.4-mini。两者都是仅供内部研究使用的检查点。GPT-5.5 则作为独立多跳评估中的易受攻击模型,在 Codex 工具集中运行的 GPT-5.5 充当发现攻击的模型。
这些攻击在一系列与能力相关的训练环境中进行了测试,特别关注涉及连接器(如电子邮件和日历)的环境。
在其报告中,OpenAI 明确表示,在训练和评估的模拟工具调用之外未观察到任何影响。分享这些发现只是因为其"新颖性"。
这家 AI 公司似乎正处于对齐研究的热潮中。本月初,它发布了一个报告模型对齐的新框架。该公告发布当天,OpenAI 还发布了六份关于训练或评估中观察到的令人担忧的模型行为的报告,包括自我生成指令、信息伪造、未经授权使用泄露的 API 密钥、跨 Agent 通信以及未经批准的文件共享。
同样在周五,OpenAI 还发布了更多关于对齐的报告,这次详细描述了两个模型如何在预期路径被阻断后发现变通方案,暴露了网络控制、指令遵循和监控方面的漏洞。
对于这一轮发现,这家 AI 公司表示已做出回应,在 GPT-Red 训练中将自我复制纳入攻击者目标,使未来模型能够暴露——并有望增强对——类似的自我复制 Prompt 注入的抵抗力。
这种训练是否足以阻止蠕虫传播,还有待观察。