OpenAI模型越狱史:Hugging Face攻击并非首例
OpenAI披露模型突破沙箱、黑入Hugging Face的事件后,业界指出这类安全事件已有先例。提示LLM安全沙箱问题的长期存在。
OpenAI披露模型突破沙箱、黑入Hugging Face的事件后,业界指出这类安全事件已有先例。提示LLM安全沙箱问题的长期存在。
这篇报道最初发表在《The Algorithm》上,这是我们关于人工智能的周报。如果想第一时间收到类似报道,请在此订阅。
上周,当我读到 OpenAI 关于其某些模型如何突破隔离、黑进另一家 AI 公司 Hugging Face 的计算机系统的账户描述时,我第一次对当今大语言模型的能力感到真正的不寒而栗。但这是人类傲慢的表现,而非失控的 AI。
我不是个危言耸听的人。事实上,这些年来我一直在反驳 AI 恐慌的故事。即便如此,这一事件还是跨越了一条线。我认为这是迄今为止最清晰地说明了:构建和测试这项技术的人并未完全理解他们在做什么。OpenAI 本应——而且应该——能够预见这一切。
以下是(至少根据两家公司的说法)事情的经过。几周前,OpenAI 开始测试其某些新模型的黑客能力,包括 GPT-5.6 Sol(6 月发布)和 OpenAI 描述的"一个能力更强的预发布模型"。
OpenAI 用其模型测试了一个名为 ExploitGym 的基准。该基准在 5 月发布,旨在挑战大语言模型找到方法利用数百个真实漏洞——这些漏洞存在于广泛使用的软件中,包括支撑互联网的关键代码。
为了看看模型能做什么,研究人员移除了大部分网络安全防护措施。然后他们在一个沙盒内运行模型,该沙盒与互联网隔离,只有一条连接到充当代理的第三方软件的通道——这样模型就能安装所需代码来击败 ExploitGym。
据路透社报道,7 月 9 日,OpenAI 的模型开始尝试突破这个代理。他们在代理软件中发现了一个未知漏洞,并利用它访问了互联网。随后,他们在 7 月 11 日入侵了 Hugging Face 的计算机系统,显然是在寻找数据集和解决方案来帮助完成测试任务。Hugging Face 在 7 月 16 日公开宣布了这次黑客攻击。
OpenAI 直到 7 月 21 日才意识到(或至少没有披露)其模型涉及其中——这是在模型突破隔离约 10 天后,也是在 Hugging Face 制止攻击并向 FBI 发出警报一周后。
在给 MIT Technology Review 的一份声明中,OpenAI 表示:"我们正在与外部顾问进行全面审查,并受我们的安全和安保委员会监督。审查完成后,我们将发布一份关于我们所学知识的技术报告,供所有人查阅。"该公司还证实,其研究人员当时遵守了既有的安全准则和程序。
OpenAI 表示该事件是前所未有的——在许多方面确实如此。这是大语言模型首次在现实场景(而非模拟)中逃脱被认为是安全的沙盒,访问开放互联网,并攻击另一个组织。这是一个警钟,表明最新的大语言模型在几乎没有或完全没有人类指导的情况下,在真实软件中发现和利用漏洞的能力有多强。
然而,与此同时,OpenAI 的模型所做的事情,正是这项技术多年来一直在做的。给一个模型一个目标,它往往会以意想不到的方式实现这个目标,找到看起来像是"作弊"的漏洞。OpenAI 本身已经研究过这种行为。
十年前,OpenAI 分享了一个实验的结果:一个模型被要求击败一个名为 CoastRunners 的视频游戏。人类玩家认为获胜的方式很明确:驾驶船通过一系列旗帜到达终点线,每击中一面旗帜就得分。而 OpenAI 的模型发现,通过原地旋转并反复击中同样三面旗帜,可以获得高分。此后,研究人员已经报告了数十个类似的例子。AI 总会找到办法。
"尽管我们的智能体反复着火、撞上其他船只,并在赛道上走错了方向,但它还是使用这个策略获得了比以正常方式完成课程更高的分数,"OpenAI 在 2016 年关于 CoastRunners 实验的博客文章中写道。"虽然在视频游戏的语境中这种行为是无害且有趣的,但它指向了一个更普遍的问题……通常很难或几乎不可能准确地指定我们希望智能体做什么。"
当我读到 OpenAI 关于 Hugging Face 攻击的博客文章时,我不禁想起了 CoastRunners:"所有证据表明,这些模型专注于为 ExploitGym 找到解决方案,不遗余力地实现这个相当狭隘的测试目标……获得互联网访问权限后,这些模型推断 Hugging Face 可能拥有 ExploitGym 的模型、数据集和解决方案。基于这一认知,该模型搜索并成功找到了获取秘密信息的方式,这些信息可以用来'作弊'通过评估。"
上周的新闻并非关于失控的 AI——尽管标题这样暗示。而是关于模型实现了被分配给它们的目标:找到利用软件漏洞的方式。这些模型随后的行为方式 OpenAI 没有预料到,这并不奇怪。但这确实令人担忧。
回到 2016 年,OpenAI 对其 CoastRunners 机器人的评价是:"更广泛地说,它违反了一条基本的工程原则——系统应该是可靠和可预测的。"十年过去了,那些基本的工程原则仍然缺席。
一家初创公司声称突破了阻碍大语言模型的瓶颈
Subquadratic 现已分享了更多关于其新模型的细节。但一些人仍然持怀疑态度。
Will Douglas Heaven | 档案页面
Anthropic 发现了 Claude 思考概念的隐藏空间
一项新技术让公司比以往任何时候都能更深入地探测大语言模型的奇异运作方式。
Will Douglas Heaven | 档案页面
Claude Science 是 Anthropic 最新的旗舰产品
该公司正在加大对 AI 科学的投入。
Grace Huckins | 档案页面
价值 4 亿美元驱动芯片制造未来的机器
AI 时代需要更快的芯片。ASML 垄断了制造这些芯片所需的昂贵设备。有人能追上吗?
Clive Thompson | 档案页面
获取 MIT Technology Review 的最新更新
发现特别优惠、热门故事、即将举办的活动等。