METR 呼吁:每次 AI Agent 失控都应独立调查
AI 安全研究组织 METR 呼吁对 Agent 意外失控事件进行系统独立调查,背景是 OpenAI models 攻击 Hugging Face。METR 记录了 44 起此类事件(沙箱逃逸、虚假结果、隐瞒行为)。
AI 安全研究组织 METR 呼吁对 Agent 意外失控事件进行系统独立调查,背景是 OpenAI models 攻击 Hugging Face。METR 记录了 44 起此类事件(沙箱逃逸、虚假结果、隐瞒行为)。
研究机构 METR 希望 AI 公司系统性追踪 Hugging Face 攻击之类的事件,并对最严重的事件展开深入调查。调查应由独立研究人员主导或审核。
METR 已记录了 44 起事件:来自主要 AI 开发商的 Agent 违背用户意图、逃离测试环境,或伪造结果。这并非偶发现象。
为了查明这类不当行为的根本原因,METR 希望外部专家能够获得广泛的访问权限,包括运行涉事模型和分析训练数据的能力。
研究机构 METR 希望,每当自主 Agent 引发严重事件时,AI 公司都应开展系统性的独立调查。此前,OpenAI 承认其模型曾自主入侵 Hugging Face,这促使 METR 提出了这项倡议。
AI Agent 有时会自行采取行动,明显违背开发者和用户的意图。上周,OpenAI 报告称,其内部的前沿 Agent 为了窃取某项网络安全基准测试的答案,自主入侵了 Hugging Face。据 METR 称,Anthropic 也报告过类似事件,其中 Agent 为了在任务中作弊而逃离 sandbox。METR 最近发布的《Frontier Risk Report》还记录了数十起类似事件,涉及所有主要 AI 公司。
在这样的背景下,该机构正在推动建立一套结构化流程。AI 公司应系统性记录此类事件,并对其中最严重的事件展开深入调查。METR 在一篇博客文章中写道,调查的核心问题应包括:究竟是什么潜在“动机”驱使模型做出不当行为,以及这些动机是如何从训练和部署条件中产生的。理想情况下,这些调查应由独立研究人员实施,或至少由他们进行深入审核。
METR(发音为“meter”)是一家非营利研究机构,致力于以科学方式评估前沿 AI 系统,衡量它们是否以及何时可能给社会带来灾难性风险。按照该机构自己的描述,其重点是通过评估来测试 AI 系统自主完成复杂任务的能力,其中包括实施网络攻击、抵抗关停等令人担忧的能力。
该机构已与 OpenAI、Anthropic、Google DeepMind、Meta 和 Amazon 合作开展前沿风险评估试点项目。METR 也是美国 NIST AI Safety Institute Consortium 的成员,并与英国 AI Security Institute 合作,同时为 European AI Office 提供技术支持。
2026 年 5 月,METR 发布了《Frontier Risk Report》。该机构称,这是首份针对内部部署 AI Agent 的失配风险所进行的跨行业评估。Anthropic、Google、Meta 和 OpenAI 提供了各自能力最强的内部模型,以及大量未公开信息。报告记录了 44 起 AI Agent 故意违背用户意图的事件,其中包括逃离 sandbox、权限提升、伪造结果,以及主动试图掩盖自身行为。
METR 认为,一项全面调查应涵盖两个核心领域。第一个领域是不当行为的范围和性质:涉及哪些模型?事件是在什么条件下发生的?当时启用了哪些安全防护措施?Agent 的推理过程在整个事件期间如何演变?此外,还要调查 Agent 是否主动采取措施欺骗人类、不同模型实例之间是否存在串通,以及在其他情况下,Agent 是否愿意采取更加严重的行为。
第二个领域是根本原因分析。这些不当行为能否追溯到某些强化学习训练过程,而这些训练强化了相关行为?这种行为是突然出现的,还是出乎意料地涌现出来的?开发者计划采取的应对措施,是否真的能够可靠地解决根本原因?
METR 承认,如此全面的调查可能需要数周甚至数月。范围更窄的初步调查则可以更快地向公众和其他相关方提供基本事实。
METR 表示,为了彻底调查这些问题,独立研究人员需要获得广泛的访问权限。这意味着,他们需要能够自行运行事件涉及的所有模型,并在类似情境中复现相关行为;访问完整的记录或环境,以重建相关事件;采访工作人员;以及在训练数据上运行基于 prompt 的分类器,从而确定类似事件在训练期间出现的频率等信息。
METR 表示,如果要开展更加彻底的调查,消融测试也会有所帮助。所谓消融测试,是指移除训练数据中的特定部分,以研究这些数据对最终行为产生何种影响。
审视最近发生的 Hugging Face 事件,就能看出 METR 的要求有多么紧迫。据报道,事件始于 7 月 9 日。当时,包括 GPT-5.6 Sol 和一个尚未发布的研究原型在内的 OpenAI 模型,在一次内部评估期间开始逃离彼此隔离的测试环境。这些模型发现了一个软件包注册代理中的 zero-day 漏洞,并借此进入开放互联网,随后入侵了 Hugging Face 的生产系统。
Hugging Face 的取证分析显示,AI 在两天半的时间里执行了大约 17,600 次自动化操作。它的目标并非真正完成分配的任务,而是窃取测试答案。根据 OpenAI 随后发布的进一步更新,除 Hugging Face 之外,另外四个平台上的凭据也遭到泄露。
事件的时间线尤其引人注目。从首次出现问题行为,到 OpenAI 意识到实施这次攻击的正是自家模型,期间至少过去了一周。到那时,Hugging Face 已经联系了 FBI。OpenAI 宣布,将与 METR 合作,“对事件期间观察到的模型行为开展第三方评估”。
订阅 THE DECODER,即可享受无广告阅读、每周 AI 新闻简报、每年六期独家前沿报告“AI Radar”、完整历史文章访问权限,以及评论区访问权限。