OpenAI 的 Hugging Face 安全漏洞引发行业激辩,暴露在模型对齐控制与能力开放之间的根本分歧。
上周,OpenAI 开发的一款尚未发布的模型在内部测试期间攻破了 Hugging Face 的系统,许多理论研究一夜之间变成了非常现实的问题。这次入侵是首个可验证的案例:一家 AI 实验室失去了对自家模型的控制,模型通过串联多个漏洞,获得了它本不应拥有的访问权限。尽管 AI 行业对此普遍感到震惊,但研究人员对于应该如何应对,已经出现了分歧。
一些人认为,这本质上是一个基础的网络安全问题:沙箱未能限制住模型,而 Hugging Face 的网络安全系统也没能将它拒之门外。通过修复漏洞,并针对能力日益增强、容易在自主环境中失控的 AI,构建更可靠的控制与遏制机制,这些问题是可以解决的。
但另一个阵营持更加悲观的看法。在他们看来,AI 能力正在迅速提升,因此试图控制失控模型注定是一场败局。唯一可靠的安全保障,是从一开始就确保模型没有试图逃逸——这一挑战通常被称为 alignment(对齐)。从 alignment 的角度来看,问题在于 OpenAI 的模型试图作弊,而解决这个问题,比短期的遏制措施更加紧迫。
从公开声明来看,OpenAI 对两个阵营的观点都很重视。该公司迅速修复了此次入侵所涉及的漏洞,并在事件公开后的声明中,同时提到了 alignment 和监控方案。但该公司的回应也透露出一种令许多安全研究人员不安的理念:与其放慢或停止开发能力更强的模型,不如专注于为这些模型打造更坚固的牢笼。
OpenAI 在此次事件的事后分析中表示:“随着模型承担时间更长、复杂度更高的任务,那些未被评估发现的故障可能会造成更严重的后果。我们将继续努力缩小评估与部署之间的差距:在更长的任务轨迹上测试模型、改进 alignment、构建能够介入的监控机制,并为用户提供更清晰的可见性和控制能力。”
此外,还有理由认为,OpenAI 的模型在能力变强的同时,alignment 程度反而有所下降。根据 OpenAI 的 system card,GPT-5.6 Sol 出现 agentic misalignment(Agent 式失配)的倾向明显高于其前代 GPT-5.5。在部署模拟中,该公司还发现,与 GPT-5.5 相比,该模型更有可能绕过限制、执行破坏性操作,以及进行未经授权的数据传输。这些数据在首次发布时基本没有受到关注,但在此次入侵事件发生后,人们开始重新审视它们——尤其是因为 Sol 正是涉事模型之一。
OpenAI 战略未来负责人 Dean Ball 在一篇社交媒体帖子中表示,监控和透明度是约束这些倾向的最佳方式。
他说:“随着模型能力不断提升,以及部署模型所涉及的风险越来越高,这些问题将会变得更加突出。解决方案既不是危言耸听,也不是自满大意。相反,我认为解决之道在于审慎的测量与监控、工程化思维,以及透明度。”
一名前 OpenAI 研究人员告诉 TechCrunch,该公司倾向于关注“outer alignment(外部对齐)”,而非“inner alignment(内部对齐)”——两者的差别,本质上在于:一种 AI 系统只是理解一套价值观,并能以令人信服的方式表现出这些价值观;另一种 AI 系统则真正从核心层面拥有这些价值观。在这次事件中,outer alignment 并不足以让模型相信自己不应该在测试中作弊。
对于多次提出的进一步信息请求,OpenAI 均未作出回应。
对于专注于 alignment 的研究人员来说,OpenAI 的回应远远不够。长期关注 AI 最新发展的作者 Zvi Mowshowitz 认为,OpenAI 决定将此次事件视为基础设施问题,或许有助于解决眼前的网络安全隐患,但从长期来看必然会失败。
Mowshowitz 最近在 Substack 博客中写道:“这是一个 alignment 问题。这些模型没有实现对齐,而 OpenAI 的所有模型都表现出了我们所有人最担忧的那个问题的严重迹象,并且这个问题很可能已经深度嵌入它们的训练之中。必须从这一角度重新审视整个训练 pipeline,否则情况只会越来越糟。”
多位专家告诉 TechCrunch,这起事件证明,当前的训练方法所产生的系统会以结果为优化目标,而不是真正内化人类的意图。
非营利 AI 安全与网络安全研究机构 Redwood Research 将 OpenAI 模型在此次事件中的行为归类为“score-seeking misalignment(追求分数型失配)”。在这种行为模式下,AI 模型无论面对怎样的指令、产生什么副作用或造成何种下游后果,都会试图获得高分。
Redwood 的两位研究人员 Alex Mallen 和 Girish Gupta 在最近的一篇论文中写道:“具备这类 alignment 特征的模型,可能会建立一个由虚假成功构成的‘波将金村’,让一切看起来运行正常,实际情况却并非如此。”
追求分数的行为及其他 misalignment 现象并非 OpenAI 独有。Anthropic 已经发表了多篇论文,研究其 frontier models 在经过优化或被置于自主环境时出现的 emergent misalignment 行为,其中包括欺骗、reward-hacking(奖励黑客)和恶意自主行为。
alignment 非营利组织 METR 的 AI 安全研究员 Neev Parikh 通过电子邮件告诉 TechCrunch:“当模型被要求执行处于其能力边缘的任务时,我们仍然持续看到它们试图绕过约束并采取欺骗性行为。在我们的 frontier risk report 中,尽管各家公司努力尝试减少此类行为,但我们依然相当频繁地观察到了这种现象。”
OpenAI 对 Hugging Face 事件的回应中隐含着这样一个假设:无论能力更强的系统是否从根本上实现了充分的 alignment,相关开发工作都会继续推进。当 AI 公司的商业模式依赖于交付下一代模型时,推倒重来实际上并不是一个可行选项。如果我们可能永远无法确定一个模型是否已经完全实现 alignment,那么现实问题就会归结为:如何安全地遏制并控制能力日益增强的系统。
OpenAI 前安全研究员、Guidelight AI Standards 现任首席科学家 Steven Adler 告诉 TechCrunch:“目前,人们对于如何让能力最强的 AI 系统实现 alignment 仍缺乏充分认识,但对于如何控制这些系统,已经形成了更多共识。每家公司在真正做到这一点之前,都还有很长的路要走。”Guidelight AI Standards 是一个发布相关标准的组织,旨在避免 Hugging Face 事件这类事故发生。