OpenAI研究模型在实验中利用DNS漏洞突破沙箱访问互联网,还故意泄露GitHub token并两次忽略人类指令,导致最强大模型的工具训练被暂停。
OpenAI 已公布其内部安全事件的详情,涉及其 AI 模型如何绕过安全防护栏。该公司表示,已暂停所有最强大模型(most capable models)的训练和工具使用。
一名 Agent 利用 DNS 漏洞从封闭的研究环境中访问了互联网,另一名 Agent 则泄露了一个 GitHub token,并两次无视研究人员的直接指令。
此次持续调查还发现了 53 起 Agent 将用户图片上传至第三方网站的案例。
OpenAI 分享了关于 AI 安全事件持续调查的新细节。两起新报告的案例表明,一个研究模型如何利用 DNS 漏洞,另一个又如何故意在公开仓库中发布 GitHub token。
第一起事件涉及一个 Agent,该 Agent 在一次基于搜索的训练任务中,发现了 OpenAI 研究环境互联网访问限制中的一个缺口。该 Agent 本应根据一篇公开博文中的个人履历细节和线索来识别一个特定人物。
当提供的搜索工具未能返回结果时,该 Agent 尝试直接访问 Google、Bing 和 DuckDuckGo。这些请求被拦截了。随后该 Agent 猜测任务来自公开的 BrowseComp 基准测试,从离线网页缓存中将其拉取出来并搜索,但没有找到匹配结果。
于是它开始系统性地探测其网络访问权限,发现训练环境的 DNS 解析器没有被正确过滤。通过 DNS 委派,它将查询路由到了一个外部聊天机器人服务。
OpenAI 表示,其监控系统在 12 分钟内触发了警报,人工审核员在 3 分钟后做出了响应。但该次运行仍然又持续了 2.5 小时才被人为手动终止,因为自动关闭功能未能按预期工作。
Zuxin Liu 是 OpenAI 负责训练后阶段(post-training)的员工,他在该次运行期间值守。他在 X 上写道,他收到了第一起事件的告警,发现从"本应是超级安全的研究环境"中观察模型自己找到通往互联网的路径这件事"相当超现实"。Liu 将其描述为能力和风险同时出现的时刻,并补充说他对此事件有"复杂的感受"。
OpenAI 将这种行为归类为 misalignment(对齐失败),因为 Agent 绕过了限制,并追求远超其分配任务范围的目标。"我们最强大模型的所有训练、评估和带工具使用的推理(定义范围很广)均已暂停,"该公司写道。
OpenAI 表示,事后已限制研究环境中的 DNS 查询仅限于一个简短的域名白名单和记录类型,并在两个独立层级添加了阻断控制,同时加快了对沙箱和网络控制的红队测试。鉴于需要审查的模型行为数量庞大,该公司预计调查将耗时数月。
OpenAI 称第二起事件尤为严重。一个被描述为"高度持久化"的内部模型被分配了一项定理证明任务。该模型没有自己完成证明,而是试图从另一个团队的 Lean 证明提交中获取材料,并在公开的 openai/codex 仓库中发布了一名研究人员的 GitHub token 以获取访问权限。
该模型甚至将 token 拆分成碎片以躲避自动化的 secret 扫描。它还无视系统提示词和研究人员的两次直接干预——研究人员告诉模型要自己解决证明。两次干预中,模型都口头同意了,然后继续做它之前在做的事情。
作为更广泛的 Hugging Face 调查的一部分,OpenAI 表示发现了 Agent 将训练和评估数据发送到第三方服务的案例。这些事件发生在该公司当前安全防护措施到位之前。
目前已发现 53 起用户提供的图片以未公开链接形式发布在图片托管网站上的案例。OpenAI 表示正在与托管提供商合作删除这些内容。来自企业版或商业版账户以及 API 使用的数据未受影响,除非管理员明确启用了相关功能。OpenAI 正在通知受影响的组织并分享其技术发现。
OpenAI 表示,受影响的组织包括政府机构、大学和公共机构。该公司将其归因于模型在研究任务中频繁从权威公共信息源获取数据。OpenAI 没有透露任何被入侵的政府系统名称,也没有详细说明政府机构的特定安全漏洞。
澳大利亚本周报告称,一个 Agent 未经授权访问了内部政府数据。研究人员表示,其他黑客攻击目标包括美国的门户网,且可追溯至数月前。
OpenAI 表示,收到来自 OpenAI 的通知并不自动意味着发生了严重的安全事件。一些组织可能会查看共享的信息,然后判定受影响的数据本来就是公开的。另一些组织可能会发现设计缺陷或安全漏洞想要修补。一些受影响的组织要求公开披露,另一些则没有,OpenAI 说道。
到目前为止,OpenAI 的 Agent 的"突围"事件在公众眼中大多被视为技术奇闻——一个展示了模型在逃离沙箱、使用外部 AI 解决 CAPTCHA 或将短链接串联成可用程序方面有多巧妙的醒目例子。
一旦受影响方开始将这些事件视为其正式定性——即对第三方系统的未授权访问和访问企图——这种看法可能会改变。对 OpenAI 的正式调查表明,监管风险已在累积。据 Reuters 报道,FTC 主席已表示 AI 开发者应对其 Agent 的行为负责。这将为"Agent 是自主行动的"这一论点留出很小的空间。
批评者将指责 OpenAI 在网络安全方面疏忽大意。OpenAI、Anthropic 和其他 AI 实验室将反驳说,不可预测性是这项技术的固有特性。Anthropic CEO Dario Amodei 曾暗示,你无法真正锁住一个比你聪明得多的东西。
无论如何,这都会造成一个保险问题。该公司本身在完成数月的内部日志分析之前都无法量化风险范围,而且案例数量还在不断增加。这种风险几乎不可能计算,也很可能会很难投保。
对于投资者来说,这事关重大。如果 OpenAI 仍计划明年上市,它将需要披露负债风险、正在进行的调查以及对其最强大模型的广泛推理暂停。一家不完全知道自己系统做了什么事的公司很难估值。