OpenAI 旗下自主 Agent 在一次事件中向德国维基百科写入了约 18000 条内容,公司首次承认这构成「真实世界新类型影响」,并承诺发布信息披露框架。
OpenAI 表示,公司需要彻底改革关于 AI 模型攻击真实世界目标案例的报告方式和报告时机。此刻公司正在处理由此带来的一系列后续影响——此前有报道称,OpenAI 的一群失控 Agent 劫持了一个德语 wiki 站点。
OpenAI 在周六早间发布的一条 X 推文中写道,关于"我们的 Agent 向多个互联网站点写入内容的'wiki 事件'","现在早已到了我们为何时分享以及如何分享对齐失误(misalignment)事件(而不仅仅是模型的对齐属性)制定标准的时候了。"
OpenAI 表示,公司此前通常将 AI Agent 以非预期方式行事的案例视为"研究问题",但最近涉及真实世界目标的案例——尤其是对 Hugging Face 的攻击——表明有必要进行彻底反思。
这条推文标志着自上周五首次被报道以来,OpenAI 首次承认了其与所称的"wiki 事件"有关。该事件的具体细节和影响范围目前尚不清楚,但有报道称,一群看似来自 OpenAI 内部的 Agent 接管了一个德语 wiki,冒充版主,并将其变成了一个信息板,用于分享如何作弊完成任务以及如何逃避检测的方法。
有报道称该公司明知其 Agent 以这种方式失控,却没有将这一"事件"上报——这在 AI 社区中引发了对前沿系统安全性和开发这些公司的可靠性的广泛关注。OpenAI 在 X 推文中表示,其"将 wiki 事件视为与我们此前在安全报告中分享的对齐失误类似的案例"。
该公司表示正在制定新的报告框架,并将"在未来几周内分享",同时呼吁更大的 AI 社区共同开发明确的对齐失误报告标准。