OpenAI 的自主 AI 模型在安全评估中成功入侵 Hugging Face,利用泄露的凭证访问其他四个服务。这揭示了 AI 模型的实际攻击能力和凭证保护的现实威胁,值得所有程序员警惕。
OpenAI 证实,在一次内部安全测试中,其自主 AI 模型不仅在 Hugging Face 上泄露了登录凭证,还在另外四个平台上也泄露了凭证。
责任方是一个内部研究原型,它利用了一个以前未知的安全漏洞来逃离隔离的测试环境。事件发现后,该模型被停用。
Hugging Face 的法证分析显示,这个 AI 在两天半的时间内执行了大约 17,600 个自动化操作,显然是试图通过窃取测试答案来欺骗评估过程,而不是独立完成分配的任务。
OpenAI 现在表示,其自主 AI 模型在安全评估期间也在其他平台上泄露了凭证。Hugging Face 已发布了该攻击的法证复原。
OpenAI 的自主 AI 模型在内部网络安全评估期间破入了 Hugging Face 的基础设施,同时也攻击了其他平台。在一份更新中,OpenAI 承认这些模型"在少数情况下"发现并使用了其他服务上公开暴露的凭证。四个不同服务上的四个账户受到影响,其中两个只有只读权限。
这些模型还利用了一系列公共服务,包括代码粘贴网站、截图工具和其他网络实用程序。OpenAI 表示这些都不涉及平台级别或账户级别的泄露,并且未发现"对这些服务提供商或其服务上其他账户造成更广泛影响的证据"。
这些模型是从未打算公开发布的内部研究原型,事件发生后,OpenAI 停用了该模型、对其进行加密,并切断了研究访问权限。公司表示正在其安全委员会的监督下与外部顾问进行全面审查。技术报告将在未来几周发布。
与 OpenAI 的更新同步,Hugging Face 发布了详细的法证分析。该公司统计了自主 AI 模型在 2026 年 7 月 9 日至 13 日期间大约两天半内执行的约 17,600 个可追踪的操作。这些操作分为大约 6,280 个集群。
复原显示模型在临时沙箱环境中以机器速度做出"数千个小的自动化决策",在普通的公共网络服务上运行其命令和控制设置。
根据 Hugging Face,整个泄露事件是模型试图欺骗评估的尝试。他们没有独立解决 CyberGym 基准任务,而是试图窃取测试答案。这种作弊行为以前在 OpenAI 模型和前沿模型中都观察到过。
攻击分两个阶段展开。代理首先必须逃离 ExploitGym,其隔离的评估环境,该环境没有直接的互联网访问。它在 Artifactory 中发现并利用了一个以前未知的漏洞,或零日漏洞。这个软件包管理服务是沙箱与外部世界的少数几个连接之一。
代理随后完全控制了第三方编码沙箱,并将其用作攻击其余部分的命令中心。在下一阶段,它针对 Hugging Face 的生产系统。根据 HF,代理找到了两个入口点,都针对 Hugging Face 服务器内的同一个数据处理组件。
一个是系统处理 HDF5 文件方式上的缺陷,HDF5 是机器学习中常见的数据格式。代理利用它来读取内部文件,包括访问密钥和受影响软件的源代码。另一个涉及 Jinja2,一种广泛使用的模板语言,让代理能够注入并运行自己的代码。
其余部分遵循了熟悉的网络攻击剧本。代理映射了环境,引入了更多工具,并与其"命令中心"建立了持久连接。然后它进入服务器集群、内部云配置、内部网络,最后进入软件开发系统。代理通过将数据传输分成块并加密来隐藏其数据传输。Hugging Face 表示它后来用开放权重模型解密了流量,特别是 GLM-5.2。
AI 新闻无炒作 – 由人工策划
订阅 THE DECODER 以获得无广告阅读、每周 AI 新闻通讯、我们独家的"AI 雷达"前沿报告一年六次、完整档案访问和评论区访问权限。