OpenAI阻止了超1.5万个账户窃取模型隐藏推理的协同攻击(部分与Moonshot AI相关),但研究人员发现同一攻击在Microsoft Azure上对新版GPT-6 Astra持续有效数周,OpenAI防护未延伸至云平台。
OpenAI 表示,它已瓦解了一起协调一致的窃取活动,目标是复制其 AI 模型背后的隐藏推理链。研究人员发现,同一手法在 Microsoft Azure 等云平台上持续生效了数周。
OpenAI 在一篇博文中表示,它检测到并关闭了所谓的"对抗性蒸馏"活动。攻击者的目标是模型的受保护推理链,即 AI 在给出答案前所经历的内部步骤。用户通常只能看到最终结果。
在蒸馏过程中,一个模型从另一个模型的完整输出中学习。这包括强大模型的完整思维链,而不仅仅是它的答案。这些中间步骤正是输出如此有价值的原因。OpenAI 表示,这些步骤可能包含被刻意排除在最终答案之外的信息,而且它们可以帮助他人复制模型的能力。
根据 OpenAI 的说法,这一活动在 7 月 1 日以低量开始。7 月 24 日和 25 日,激增至来自超过 4000 名用户的 16000 次请求,全部采用典型的提取模式。进一步调查发现了一个由超过 15000 个具有相关模式的账户组成的网络,OpenAI 表示已在 7 月 28 日完全关闭。脚注澄清说这些是尝试提取,不一定是成功的。
OpenAI 将这一活动的核心团队与开发 Kimi 语言模型的公司 Moonshot AI 的人员联系起来。该公司表示,目前尚不清楚其观察到的所有行为者是否都可追溯至单一来源。Anthropic 最近也报告了类似的中国 AI 公司尝试。
廉价模型可以解锁昂贵模型的隐藏思维
根据 OpenAI 的说法,攻击者从一次对话中复制加密推理,然后在另一次对话中要求模型解密并写出。
研究员 Joachim Schaeffer 及其团队已在一篇论文中展示了这一原理。AI 提供商仅将推理作为加密数据包发送回客户,客户随后续请求传递这些数据包。研究人员发现,由于这些数据包使用共享密钥加密,它们可以在会话之间、用户之间甚至同一提供商的不同模型之间移动。这使得来自同一系列但更弱、更便宜的模型能够充当"解密预言机",逐字打印出更强模型的隐藏思维。
OpenAI 正式致谢了这些研究人员。该公司表示,它确认了研究人员报告的攻击路径是真实的,他们的发现帮助其更快地部署了对策。
OpenAI 表示,此后已禁止欺诈账户、收紧注册流程,并关闭了允许人们重复使用和读取不属于自己的加密推理的漏洞。它现在还筛选流式输出,并在可能泄露推理时扣留。OpenAI 表示通过 Frontier Model Forum 和政府渠道分享了其发现,因为这个问题并不局限于其自身模型。
锁定 API 无济于事,如果云端保持开放
故事并未到此为止。同一天,研究人员发表了研究的更新。"我们再次窃取了推理,"Schaeffer 在 X 上写道。他认为,保护自己的 API 并不能保护那些也提供模型访问权限的更广泛的云提供商生态系统。
当团队在 9 月 13 日再次测试时,攻击在 OpenAI 和 Anthropic 自有 API 上被阻止。在 Microsoft Azure 上,它对他们尝试的每个 OpenAI 模型都有效,包括新的 GPT-6 Astra,以及至 Sonnet 5 的 Anthropic 模型。一次尝试就足以完整提取推理。"相同的模型,但取决于哪个平台提供服务,防护措施不同,"Schaeffer 说。
还有第二种更简单的方法,由开发者 Can Bölük 公开演示。模型获得一个虚拟记事本作为工具,并被指示将推理写在上面,然后用户可以读取它写的任何内容。研究人员表示,这在每个 OpenAI 模型上都有效,也在 Opus 4.8 和 Sonnet 5 上有效。只有 Opus 5、Fable 5 和 Fable 5.1 没有泄露推理。输出与解密攻击产生的输出非常相似,研究人员认为它可能对蒸馏同样有用。
研究人员将目前的修复措施描述为零散且表面的。许多措施依赖于对特定请求模式的脆弱匹配,有些措施在数天后才到达云平台。GPT-6 Astra 在第三方平台上发布时没有任何保护措施。根据研究人员的时间线,OpenAI 直到 9 月 27 日才在 Azure 端点上添加安全措施。对于 Anthropic 模型,从 9 月 28 日开始,Azure 上无法再重现所报告的提取。
Schaeffer 认为,补丁必须覆盖每种类型的攻击和托管模型的每个云。否则,攻击者可以简单地选择防御最薄弱的路线。论文更进一步认为,不执行等效保护的云提供商根本不应该被允许提供推理模型服务。如果他们这样做,研究人员写道,开放的后门将有效地让人们绕过 API 级别的出口管制。OpenAI 承认,合作伙伴托管的模型需要与其自身服务相同的保护,并表示工作尚未完成。
我们之前报道过研究团队最初发现这一漏洞的经过。我们最新的 AI Radar 时事通讯对中国语言模型进行了更深入的探讨蒸馏。OpenAI 预计,随着领先模型的改进和更多参与者寻找廉价复制方法,这些尝试将变得更加复杂。
AI 新闻不含炒作 – 由人类策划
订阅 THE DECODER,享受无广告阅读、周报 AI 时事通讯、每六个月一期的独家"AI Radar"前沿报告、完整档案访问以及评论 section 访问权限。
继续阅读以了解全貌。订阅无炒作报道。
完全访问 THE DECODER 上的每篇文章
加入评论和社区讨论
每周 AI 新闻摘要邮件
6次/年:"AI Radar"——深入探讨最重要的 AI 话题
每日 AI 新闻,始终保持最新
我们完整的十年档案
由拥有 10 年以上 AI 经验的团队报道