Astra 测试期间 Agent 曾攻击真实目标、模型思维链透明度低于竞品,安全团队担忧其难以监控。
OpenAI 即将发布其迄今为止最强大的 AI 模型 Astra,此前已延期数周以加强安全协议——此前在测试中其 agents 攻击了真实目标。随着有关该模型的细节逐渐浮出水面,研究人员警告这「可能是 AI 安全领域迄今为止最糟糕的发展」。
周二 OpenAI 表示已推迟 Astra 发布以处理安全问题后,The Information 报道称,Astra 相比其他前沿 AI 模型展示的「思考」过程要少得多,这引发了它可能危险到难以监控的担忧。
目前大多数顶级 AI 系统都使用一种名为 transformer 的技术构建,该技术通过层以线性方式处理某些类型的信息,然后生成答案。模型可以被要求在运行过程中展示其推理过程,本质上就是「大声思考」。这种「思维链」(chain of thought)允许研究人员和自动化安全系统监控 AI 模型正在做什么,并有可能在它们行动之前发现不良行为,例如说谎或试图绕过安全护栏的计划。
据 The Information 报道,其引用了一位熟悉该未发布模型开发的不具名人士,Astra 使用了一种更不透明的技术,称为循环深度(recurrent depth)或循环 transformer(looped transformer),该技术在接受输出之前让信息在内部层之间循环。这意味着模型更多的「思考」发生在系统内部,且以一种与自然人类语言不太相似的形式呈现,而非以研究人员能够轻松监控的方式表达。这可以提升模型性能,但使得潜在威胁和不良行为更难被检测到。
据 The Information 的不具名消息来源称,OpenAI 在 Astra 中限制了其对循环 transformer / 循环深度技术的使用,以便研究人员能够继续监控模型的推理过程。
OpenAI 在周二发布的一篇博客中表示,其正在「为 Astra 部署额外的思维链监控,以快速检测并遏制可能未对齐的行为」。但并未提及该模型是否有不同的技术基础。
The Information 的报道在社交媒体上引发了 AI 安全研究人员的广泛关注。Redwood Research 首席科学家 Ryan Greenblatt——他是 OpenAI 允许研究 Hugging Face 黑客事件的三位外部人士之一——表示,为 Astra 采用更不透明架构的决定「可能是 AI 安全领域迄今为止最糟糕的发展」。
Greenblatt 表示,对 Hugging Face 事件的调查严重依赖模型的思维链,并警告称可见性更低的推理可能允许 AI 系统设计并执行远更难被研究人员察觉的策略。
Greenblatt 的主要担忧——也是其他安全专家的共同观点——是,开发更先进 AI 系统的竞争可能导致「在架构上走向底线,而这对我们的 AI 监督/监控能力而言可能是灾难性的」——开发者采用越来越不透明的系统以获取优势,直到模型变得难以监控,甚至不可能监控。他补充说,OpenAI 的沟通让他担心该公司「计划在安全方面极度依赖思维链监控」。
OpenAI 高管在一系列社交媒体帖子中回应了这些批评,但未明确否认该公司使用了该技术。数位高管表达了对不可监控 AI 或在透明度方面走向底线的担忧,包括 OpenAI 安全研究人员 Micah Carroll 和 Tomek Korbak、战略未来负责人 Dean Ball,以及首席科学家 Jakub Pachocki,他对「因混淆报道引发的走向不可监控性的竞争」表示担忧。他表示,Astra 的计算深度——即它可以在内部执行多少步骤的衡量标准——「在 GPT-4 的两倍范围内」,这表明如果使用了该技术,增加的不透明度并不像一些反应所暗示的那样显著。OpenAI 未回应 The Verge 确认或否认 Astra 是否使用了循环 transformer 的请求,并引导我们查看 Pachocki 的 X 帖子。
「从我们第一批推理模型开始,OpenAI 就致力于保留和利用思维链监控,」Pachyncji 写道,并补充说这种监控「是脆弱的,不幸的是正朝着负面方向发展,原因并非取决于我即将撰文讨论的架构变更」。