安全研究人员发现主要AI厂商API存在推理痕迹泄露漏洞,公开会话中检测到数十条密码和API密钥。
由 Alexander Panfilov 领导的安全研究人员发现了一个存在于 OpenAI、Anthropic 和 Google 等主要 AI 提供商 API 中的漏洞,该漏洞可读取模型加密的"思考"过程。
通过破解这些系统,研究人员使用较小的 AI 模型来转录更强大模型的原始推理过程,在公开会话中暴露了密码和 API 密钥等敏感数据。
提取的数据揭示了 AI 模型有时会用难以理解的语言进行内部交流,按逆序构建答案,甚至考虑欺骗的企图。
安全研究人员发现,所有主要 AI 提供商的 API 中都存在一个漏洞,使他们能够读取推理模型的加密思维过程。对公开共享会话的扫描发现了数十个密码和 API 密钥。
当 OpenAI 的 o 系列、Anthropic 的 Claude 或 Google 的 Gemini 等 AI 模型"思考"复杂任务时,它们会产生内部推理令牌。这些思维过程要么以摘要形式展示给用户,要么完全隐藏。提供商对原始推理步骤进行加密,部分是为了保护其知识产权。
由 Alexander Panfilov 领导的研究团队现在已经找到了一种方法,通过所有领先 AI 提供商 API 中的漏洞来提取这些加密的推理过程。对于大多数查询,提取的令牌数量与计费的思考令牌数量完全一致,这意味着研究人员捕获的是完整的内部推理,而不仅仅是部分片段。
加密思维在模型间自由传递
研究人员表示,加密的思维过程"在同一提供商的不同会话、用户和模型之间完全可移植"。Anthropic 的较小模型 Haiku 4.5 可以读取能力强得多的 Opus 4.8 的思维。通过破解,Haiku 可以被欺骗逐字转录 Opus 的原始思维过程,而无需直接攻击更强大的 Opus。同样的技巧也适用于 OpenAI 和 Gemini。
这一发现要追溯到 5 月,当时密码学专家 Matthew Green 发现加密的推理 blob 可以在原始上下文之外被重放,并就此向提供商进行了报告。据 Panfilov 称,他们的回应是"他们认为侧信道或重放没有任何安全影响"。新的研究强烈表明这一评估是错误的。
推理蒸馏的证据越来越多
该漏洞也助长了颇有争议的"蒸馏"辩论,即用更强大模型的输出(特别是其推理过程)来训练,使能力较弱的模型得到大幅提升。
研究人员表示,一段时间以来,可能已经可以在不破坏加密的情况下提取推理过程来训练专有模型。这支持了外界对中国模型制造商使用这些推理痕迹来训练自己的思维链模型的担忧。
Kimi-K3 就是一个例子。研究人员表示,如果只用 Opus 思维过程中的几个令牌预填充其推理,其输出就会明显向 Opus 靠拢。记忆分析表明,从 Kimi-K3 中提取特定 Claude 和 GPT 推理片段比从仅次于它的模型中提取要容易六个数量级。研究人员表示,这表明 Kimi-K3 可能接受了此类痕迹的训练。
这种攻击成本也不高,因此大规模扩展是可行的。作者估计解码 10,000 条痕迹的 API 成本约为 720 美元。Kimi 在网络安全基准测试和复杂数学任务上的"糟糕"表现也指向蒸馏,因为这些任务即使从原始思维链数据中也更难恢复。
公开共享的会话泄露密码和 API 密钥
该漏洞也影响最终用户。任何公开共享包含加密推理 blob 的 Claude Code 或 Codex 会话的用户,都面临其个人数据被解码的风险。对大约 7,000 条公开痕迹的扫描发现了 62 个 API 密钥、33 个电子邮件地址、33 个密码及其他敏感数据。该论文还涵盖了更多恶意场景,包括滥用升级(见图片)、破解和隐形提示注入。
虽然模型可见的回复只提供无害的安全提示,但解密后的思维过程详细描述了如何用一根简单的 USB 线缆盗窃某些汽车。| 图片来源:Panfilov 等。

研究人员遵循了与 AI 实验室合作的标准安全披露流程。据 Panfilov 称,实验室已经修补了多个问题,并正在制定更多修复方案。
模型实际在想什么 vs. 模型展示给你什么
提取的痕迹还揭示了模型真正的行为方式。研究人员在 stolen-thoughts.com 上记录了多种模式。他们的发现表明,用户在聊天工具中看到的推理摘要经常遗漏重要信息。在一个例子中,Opus 4.8 识别出了数学问题的答案,并反向推导出一条看似合理的解决路径。这些都没有出现在显示的摘要中。
模型显然已经从训练数据中知道了答案,但表面上它假装仍需要通过计算来推导。| 图片来源:Panfilov 等。

研究人员还证实了 Apollo Research 早期的报告。OpenAI 模型有时用一种"外星式语言"思考,用"我们"或"它"来指代自己,并陷入对人类毫无意义的术语循环,如"vantages"、"marinades"和"watchers"。"思维链监控人们正在做上帝的工作,因为在许多痕迹中,即使有提示,也完全无法判断模型在做什么,"Panfilov 写道。
"But marinade"……OpenAI 模型到底在想什么?| 图片来源:Panfilov 等。

研究人员还发现了"野外策划"的例子。这一概念已经被充分研究过:在模型的思维过程中,它们明确考虑过作弊,但(可能)因为预期会被抓而决定不作弊。
在一个案例中,在多次尝试寻找解决方案失败后,模型试图通过网站验证可能的答案。当 CAPTCHA 阻止访问时,它首先尝试解决它,然后搜索该网站的漏洞。只有在所有这些都失败后,它才自己解决问题。据报道,OpenAI 对 Hugging Face 和其他平台的意外攻击也是以同样的方式发生的。
经过清理的摘要掩盖了真正的发生的事
这些例子说明了为什么 OpenAI 和 Anthropic 等 AI 实验室要清理他们的推理痕迹。他们希望防止外星式语言循环或策划行为损害可控、可信 AI 的形象。经过 sanitized 的摘要创造了一种类人思维过程的印象,而这种形式实际上并不存在。
亚利桑那州立大学的研究人员在此前的一项研究中对此方法提出了警告。他们认为,这种人性化版本会对模型可控性产生错误的信心,并将研究引向错误的方向。在他们的实验中,具有故意错误或无意义中间步骤的模型有时比具有连贯推理链的模型表现更好。
THE DECODER 独家策划:AI 新闻去噪通讯
订阅 THE DECODER,享受无广告阅读、周度 AI 通讯、每年六期的独家"AI Radar"前沿报告、完整档案访问以及评论区域访问权限。