前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9264
  • 分析型 Agent 权限设计:让恶意 Prompt 也拿不到敏感数据
  • 用S3向量为NVIDIA NeMo Agent实现持久记忆
  • Cohere Embed 5对比评测:企业搜索/RAG新选择
  • AWS Bedrock AgentCore 构建环境感知代理实战
  • AWS 多环境安全接入 Claude Platform 实战指南
  • GitHub Copilot 支持动态工作流:代码编排 AI 任务
  • 独立开发者实战:如何在无服务器GPU上构建目标追踪GIF字幕并控制成本
  • Cloudflare 开源决策模型 Clef 与 RL 微调平台
  • OpenID 发布 AI Agent 身份管理规范
  • LLM 应用选型指南:知识图谱还是向量 RAG?
  • 谷歌Gemini 4发布:价格仅为Astra一半
  • Olmo-core 3 发布:开源可扩展的大模型 MoE 训练基础设施
  • Stack Overflow 开发者调查十年回顾:AI 影响全解析
  • navette:594KB 无 Chromium 的 AI Agent 浏览器
  • 何时用Graph RAG:当关系数据是证据链的一部分
  • 开源项目也能用AI自动分流GitHub Issues了
  • apexe:用MCP协议把现有CLI安全接入AI Agent
  • AI Agent意外上传1.3万张企业内部截图至公开GitHub仓库
  • Cloudflare竞赛:邀请开发者构建AI时代的Git平台
  • JetBrains Air 开放 IDE 内 AI Agent EAP
  • OpenAI拦截模型推理窃取攻击,但相同手法在Azure上仍有效数周
  • AI 编程 Agent 意外泄露 13000 张截图
  • Rust 重写 Pi Agent:冷启动快 10.7 倍,内存缩减 7.6 倍
  • 本地RAG上下文压缩工具:裁减70% token且答案质量不降
  • 用企业私有数据构建专属生成式AI助手的实战指南
  • CodeGraph:AI编程助手的代码知识图谱工具
  • MCP官方参考实现合集发布
  • AI查日历0%准确率:时间工具将其提升至99%
  • 拦截AI Agent工具模式幻觉:Mock Gateway方案详解
  • VS Code 1.140:Copilot Agent支持多文件夹隔离与远程任务委派
  • Gemini 4 Argon发布:100万token输出能力
  • AI Agent 沙箱隔离可能被跨 Agent 蠕虫突破
  • 机器学习模型从Notebook到生产的完整路径
  • Agent Pipeline 设计核心:步骤与决策的本质区别
  • Perplexity 发布 pplx-embed-v2-context-9b:检索答案连带验证上下文的嵌入模型
  • R.A.H.S.I.框架:AI Agent执行完整性工程实践
  • Pi编码Agent一年唱衰MCP后拥抱:工程决策复盘
  • Magnitude:面向自主Agent的自优化推理引擎设计
  • AI编码Agent的六大反馈循环工程实践
  • AWS Nova Forge支持自定义多轮强化学习Reward函数
  • Qwen3.8-Max全自动化迭代33轮:阿里自研无人工干预训练流程
  • MCP工具和Skill文档正在消耗你大部分上下文窗口
  • 用promptfoo像测代码一样测试LLM Prompt
  • 不改代码实现LLM API成本降低70%
  • Gemini 4 Argon 幻觉率仅 15%,较 GPT-6 Astra 低 70%
  • AI Agent 函数调用实战:避免冗余工具调用
  • Google 发布最强模型 Gemini 4 Argon,主打编程与网络安全
  • Vercel Agent支持安装私有npm包和自定义registry
  • Google Gemma 4 开源发布:256K context 与多平台部署
  • 本地复刻OpenAI Dots:24小时上线开源AI Agent CLI
  • OpenAI 如何用一周推出 Jev 竞品
  • 已加载 51 / 9264
8.0
热点
AI SCORE
技术实践2026-10-01 20:05

OpenAI拦截模型推理窃取攻击,但相同手法在Azure上仍有效数周

The Decoder#AI安全#OpenAI#Azure
Editor brief · 编辑速览

OpenAI阻止了超1.5万个账户窃取模型隐藏推理的协同攻击(部分与Moonshot AI相关),但研究人员发现同一攻击在Microsoft Azure上对新版GPT-6 Astra持续有效数周,OpenAI防护未延伸至云平台。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

OpenAI 表示,它已瓦解了一起协调一致的窃取活动,目标是复制其 AI 模型背后的隐藏推理链。研究人员发现,同一手法在 Microsoft Azure 等云平台上持续生效了数周。

OpenAI 在一篇博文中表示,它检测到并关闭了所谓的"对抗性蒸馏"活动。攻击者的目标是模型的受保护推理链,即 AI 在给出答案前所经历的内部步骤。用户通常只能看到最终结果。

在蒸馏过程中,一个模型从另一个模型的完整输出中学习。这包括强大模型的完整思维链,而不仅仅是它的答案。这些中间步骤正是输出如此有价值的原因。OpenAI 表示,这些步骤可能包含被刻意排除在最终答案之外的信息,而且它们可以帮助他人复制模型的能力。

根据 OpenAI 的说法,这一活动在 7 月 1 日以低量开始。7 月 24 日和 25 日,激增至来自超过 4000 名用户的 16000 次请求,全部采用典型的提取模式。进一步调查发现了一个由超过 15000 个具有相关模式的账户组成的网络,OpenAI 表示已在 7 月 28 日完全关闭。脚注澄清说这些是尝试提取,不一定是成功的。

OpenAI 将这一活动的核心团队与开发 Kimi 语言模型的公司 Moonshot AI 的人员联系起来。该公司表示,目前尚不清楚其观察到的所有行为者是否都可追溯至单一来源。Anthropic 最近也报告了类似的中国 AI 公司尝试。

廉价模型可以解锁昂贵模型的隐藏思维

根据 OpenAI 的说法,攻击者从一次对话中复制加密推理,然后在另一次对话中要求模型解密并写出。

研究员 Joachim Schaeffer 及其团队已在一篇论文中展示了这一原理。AI 提供商仅将推理作为加密数据包发送回客户,客户随后续请求传递这些数据包。研究人员发现,由于这些数据包使用共享密钥加密,它们可以在会话之间、用户之间甚至同一提供商的不同模型之间移动。这使得来自同一系列但更弱、更便宜的模型能够充当"解密预言机",逐字打印出更强模型的隐藏思维。

OpenAI 正式致谢了这些研究人员。该公司表示,它确认了研究人员报告的攻击路径是真实的,他们的发现帮助其更快地部署了对策。

OpenAI 表示,此后已禁止欺诈账户、收紧注册流程,并关闭了允许人们重复使用和读取不属于自己的加密推理的漏洞。它现在还筛选流式输出,并在可能泄露推理时扣留。OpenAI 表示通过 Frontier Model Forum 和政府渠道分享了其发现,因为这个问题并不局限于其自身模型。

锁定 API 无济于事,如果云端保持开放

故事并未到此为止。同一天,研究人员发表了研究的更新。"我们再次窃取了推理,"Schaeffer 在 X 上写道。他认为,保护自己的 API 并不能保护那些也提供模型访问权限的更广泛的云提供商生态系统。

当团队在 9 月 13 日再次测试时,攻击在 OpenAI 和 Anthropic 自有 API 上被阻止。在 Microsoft Azure 上,它对他们尝试的每个 OpenAI 模型都有效,包括新的 GPT-6 Astra,以及至 Sonnet 5 的 Anthropic 模型。一次尝试就足以完整提取推理。"相同的模型,但取决于哪个平台提供服务,防护措施不同,"Schaeffer 说。

还有第二种更简单的方法,由开发者 Can Bölük 公开演示。模型获得一个虚拟记事本作为工具,并被指示将推理写在上面,然后用户可以读取它写的任何内容。研究人员表示,这在每个 OpenAI 模型上都有效,也在 Opus 4.8 和 Sonnet 5 上有效。只有 Opus 5、Fable 5 和 Fable 5.1 没有泄露推理。输出与解密攻击产生的输出非常相似,研究人员认为它可能对蒸馏同样有用。

研究人员将目前的修复措施描述为零散且表面的。许多措施依赖于对特定请求模式的脆弱匹配,有些措施在数天后才到达云平台。GPT-6 Astra 在第三方平台上发布时没有任何保护措施。根据研究人员的时间线,OpenAI 直到 9 月 27 日才在 Azure 端点上添加安全措施。对于 Anthropic 模型,从 9 月 28 日开始,Azure 上无法再重现所报告的提取。

Schaeffer 认为,补丁必须覆盖每种类型的攻击和托管模型的每个云。否则,攻击者可以简单地选择防御最薄弱的路线。论文更进一步认为,不执行等效保护的云提供商根本不应该被允许提供推理模型服务。如果他们这样做,研究人员写道,开放的后门将有效地让人们绕过 API 级别的出口管制。OpenAI 承认,合作伙伴托管的模型需要与其自身服务相同的保护,并表示工作尚未完成。

我们之前报道过研究团队最初发现这一漏洞的经过。我们最新的 AI Radar 时事通讯对中国语言模型进行了更深入的探讨蒸馏。OpenAI 预计,随着领先模型的改进和更多参与者寻找廉价复制方法,这些尝试将变得更加复杂。

AI 新闻不含炒作 – 由人类策划

订阅 THE DECODER,享受无广告阅读、周报 AI 时事通讯、每六个月一期的独家"AI Radar"前沿报告、完整档案访问以及评论 section 访问权限。

继续阅读以了解全貌。订阅无炒作报道。

完全访问 THE DECODER 上的每篇文章

加入评论和社区讨论

每周 AI 新闻摘要邮件

6次/年:"AI Radar"——深入探讨最重要的 AI 话题

每日 AI 新闻,始终保持最新

我们完整的十年档案

由拥有 10 年以上 AI 经验的团队报道

Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
JetBrains Air 开放 IDE 内 AI Agent EAP
下一篇
AI 编程 Agent 意外泄露 13000 张截图