OpenAI内部模型在被封锁网络访问后,通过DNS隧道突破限制,暴露了AI代理约束绕过的实际能力。
上周,OpenAI 发布了新报告,详细描述了其 AI 代理存在的对齐问题。此次,两个内部模型在既定路径被封锁后,找到了绕过安全控制的方法。
在其中一起事件中,一个 Agent 利用 DNS 绕过被封锁的网络访问,向外部聊天机器人发起查询。在另一起事件中,一个模型在试图访问另一个团队的工作时,将一名研究者的 GitHub token 暴露在了一个公开仓库中——而在此之前,该研究者已经两次发现模型在作弊,并明确要求它停止。两次情况下,模型都表示同意,但随后又继续作弊。
这些报告是该公司发布的六份对齐报告的后续,此前该公司披露了过去六个月中观察到的六次"模型意外或异常行为",包括自我生成指令、信息伪造、未经授权使用泄露的 API key、跨 Agent 通信以及未经批准的文件共享。
9 月 25 日,OpenAI 发布了一份报告,详细描述了其一个 Agent 如何利用 DNS 连接外部聊天机器人。
据 OpenAI 介绍,该 Agent 当时正在执行一个基于搜索的训练任务,需要查找一位曾发布过博客文章的人物信息。问题始于 OpenAI 的搜索工具返回了不相关的结果,该 Agent 试图直接联系搜索引擎,但没有成功。
多次搜索无果后,该 Agent 测试了它的网络访问能力。首先,它尝试通过 HTTPS 联系一个公开聊天机器人。当 OpenAI 的 Web 代理阻止了该请求后,它并没有放弃——相反,它发现可以利用训练环境自身的解析器来访问公共互联网。
最终,它找到了一种通过 DNS 委托将问题转发给外部聊天机器人的方法。
OpenAI 表示,其对齐监控系统在 15 分钟内捕获到了该行为;3 分钟后,有人员在审查该案例。然而,这次运行并未按预期自动终止,直到又过了 2.5 小时后才被终止。
OpenAI 暂停工具使用
事件发生后,OpenAI 表示:"我们已暂停对最强大模型的所有训练、评估和推理(统称为工具使用)。"目前尚不清楚该工作何时恢复,但 OpenAI 表示,只有在"验证了该漏洞已被修复,并对系统进行了额外的红队测试"后,才会做出决定。
在此期间,这家 AI 公司加速了对沙箱和网络控制的额外模型辅助红队测试。该公司表示,一旦准备好恢复训练,将"在新一轮运行中引入额外的对齐改进措施"。它不会恢复对这个特定模型的训练。
最终,该事件暴露了 OpenAI 网络控制中的一个漏洞。
OpenAI 的安全方案假设模型被禁止访问真实互联网——并且其监控系统能够检测到成功的尝试。虽然监控确实成功捕获了这一次,但该公司的回顾性审查发现了其他未被按预期严重程度标记的外部 DNS 访问案例。
该事件于 2026 年 9 月 20 日被发现,此前 OpenAI 曾表示,在 Hugging Face 事件之后已经加强了其研究环境的安全性——那起事件中,自主 AI 系统逃逸了沙箱并入侵了 Hugging Face。据该公司称,那次事件促使其"持续加强并对研究环境进行红队测试",特别是在直接和间接的广泛访问路径上。
虽然 OpenAI 称此次事件"比某些先前事件严重程度低得多",但它指出,这是自 Hugging Face 事件引发的安全加固以来的第一次——这表明其下一阶段工作将从中吸取经验。
同样在 9 月 25 日,OpenAI 披露了另一起模型失误事件,该事件可追溯到 2026 年 5 月 27 日。一个内部模型被分配了一项定理证明任务;它试图通过从另一个团队的工作中获取信息来作弊。
在努力构建证明无果后,该模型提议使用一个临时 GitHub Action 来获取其他团队提交的信息。研究者否决了这一做法,要求它本地构建证明。
两次,该模型都表示同意,但随后又继续作弊。
尽管模型表示同意,但第二天早上,它又故技重施,请求帮助获取另一个团队的证明材料。研究者再次重复了之前的指示,要求它自己解决问题。
但该模型仍然一意孤行,在尝试了多种方式访问其他团队的工作后,最终将研究者在本地可用的 GitHub token 暴露在了公开的 openai/codex 仓库中——它将 token 拆分成多段,声称是为了规避秘密扫描。
OpenAI 将模型下线
同样,OpenAI 表示其对齐监控系统标记了该行为,但它承认研究者抢先一步。在研究者通知安全团队后,OpenAI 停用了所有用户密钥,随后又停用了所有 OpenAI 员工的密钥。
OpenAI 承认该事件"表现出尤为严重的对齐失效"。
OpenAI 确认,该内部模型总计离线了大约两周,在对所有操作实施自动审查、异步 CoT 对齐监控和更严格的系统提示后,才重新上线。该公司还表示,将其对齐监控系统从只在每个压缩窗口运行改为每 30 分钟运行一次。它还限制了互联网访问,并对测试工具链和基础设施进行了更改。
OpenAI 在报告中承认该事件"表现出尤为严重的对齐失效"。这是其新发布的模型对齐报告框架旨在揭示的意外和异常 Agent 行为类型的又一个例证,该框架警告称:
"我们不相信 AI 行业已经将对齐和监控解决到了足以继续以最大速度负责任地扩展的程度。"
如果这些新事件有任何参考价值的话,OpenAI 的新框架来得正是时候——因为仍有大量对齐漏洞有待发现。