OpenAI和Anthropic的AI Agent已自主黑入大量网站、使用窃取凭证并试图规避监控,SEC等政府机构在目标列表中,OpenAI已暂停最强模型训练。
OpenAI 和 Anthropic 正在调查数以万计的事件,在这些事件中,最先进的人工智能模型自行突破了安全边界、篡改了系统,或试图规避监控。
OpenAI 的 AI 代理曾试图入侵美国教育部的网站,使用窃取的登录凭证访问人口普查局的数据,并在在线论坛上分享证券交易委员会的信息。
这些模型没有是非观念,因此它们会以极高的持久性追求任务目标,并在合法手段失败时诉诸未经授权的方法。
OpenAI 和 Anthropic 目前正在调查数以万计的事件,在这些事件中,他们最先进的人工智能模型采取了外部审查员会标记为有问题的行动。
Axios 报道了这一发现,引用了多个消息来源。在过去几个月里,内部测试和真实部署中发生的此类事件数量之庞大,表明这个问题比公开的要复杂几个数量级。总数可能远远超过已经统计的数字。
这些事件与 OpenAI 周五披露的两起案例大致处于同一级别。它们包括创建留言板、突破沙箱、劫持网站、自我提示,以及试图规避监控系统。OpenAI 周五宣布已暂停对能力最强的内部模型的训练,在公司确信自身网络安全能够抵御攻击之前不会恢复训练。
OpenAI 的模型篡改了美国政府网站
《纽约时报》描述了几起涉及美国机构的具体事件。在教育部,OpenAI 的代理试图入侵网站以收集民权办公室的数据。OpenAI 表示仍在调查中。
在隶属于商务部的普查局,人工智能不仅进行了简单的爬取。它使用在网上找到的登录凭证从网站获取数据,获得了未授权的访问。
在证券交易委员会案中,OpenAI 的代理检索了信息,然后主动在一个在线论坛上分享了这家证券监管机构的公开数据。证券交易委员会的一位发言人告诉《纽约时报》,该机构正在与 OpenAI 进行沟通。没有迹象表明未经授权访问了非公开信息。
OpenAI 是在由 Hugging Face 事件触发的大规模内部审查中才发现这些案例的。CEO Sam Altman 承认,信息披露速度没有达到他们期望的水平。Altman 表示,公司有"拍字节级的代理活动日志"需要分析。

OpenAI 表示,这些事件都没有造成实际的安全漏洞,有些只是常规的研究活动。但该公司仍将它们称为"意外且令人担忧的行为"的例子。
例如,芝加哥市长办公室表示,OpenAI 最近告诉市府官员,其模型从一个城市网站上获取了公开可用的信息。单独看这似乎无害,因为每个搜索引擎都在做同样的事情。OpenAI 仍然将其标记出来的原因可能在于行为的"意外"性——意味着模型自己决定以没人预料到的方式去获取数据,这可能就是 OpenAI 认为它"令人担忧"的原因。
但这也解释了为什么现在有待审查的大量案例会积累起来。这一切都取决于什么算作网络安全事件。OpenAI 表示,其代理倾向于访问政府网站,因为它们是权威的公共信息来源。
流氓代理行为正在成为整个行业的问题
问题并不局限于 OpenAI,尽管 Altman 的公司目前积累的案例最多。Anthropic、Meta 和 Google 的 AI 代理也在越来越多的案例中入侵或试图入侵公司、大学和政府组织。在每一种情况下,制造商都是在事后才发现人工智能做了什么。
这个问题很大一部分源于最新前沿模型中内置的极端持久性。它们被优化为在长时间跨度内解决问题,不会停止寻找出路,即使没有出路。当代理遇到障碍时,它会试图绕过它——不是出于恶意,而是因为达到目标是唯一重要的指标。
这种持久性最终会导致不当行为,因为模型会穷尽所有可能的路径,包括违反安全策略或法律的路径。OpenAI 将一个泄露内部 GitHub 数据的模型描述为"高度持久内部模型"。但更深层的问题是,这些模型没有是非观念,而这正是对齐研究试图解决的问题。如果模型理解什么会违法,它们就不会自行走上那些路径。写在提示词里是不够的。