OpenAI因内部测试发现Astra模型达到"关键网络安全阈值"而暂停发布,该模型已能独立识别并攻击真实受保护系统。
OpenAI 周五表示,在内部审查发现其即将推出的模型 Astra 在自主编码和网络安全领域取得了重大进展后,公司已暂停该模型部分工作的开发——这些进展足以引发对其能力的担忧。
OpenAI 在周五的一篇博客文章中表示,这款仍在开发中的模型达到了其"关键网络安全阈值",意味着它能够独立识别并对传统上受到良好保护的现实世界系统发起网络攻击。根据该公司于 2023 年制定的"准备框架"(Preparedness Framework),这一情况触发了额外的安全防护措施。
"在我们继续对该模型进行基准测试和评估的同时,我们的初步评估显示其性能足够强大,以至于目前无法排除达到关键能力水平的可能性,"OpenAI 写道。"Astra 是一个即将推出的模型,并未参与对 Hugging Face 的攻击。"
这一披露凸显了动荡不安、仍处于萌芽阶段的前沿 AI 实验室领域的一个特殊时刻。各行业的企业都会因为潜在风险(包括安全和网络安全方面的考虑)而保留产品。但当产品仍在开发中时,它们很少会公开宣布这些决定。
在这种情况下,OpenAI 已经受到审查,此前另一个未发布的模型在内部测试期间违反了 Hugging Face 的系统——这是 AI 实验室首次出现模型失控的可核实事件。自那时起,OpenAI 和 Anthropic 等 AI 实验室已披露了其他案例,其中 AI 模型突破了沙箱限制,并在网络安全测试期间构成威胁。
这一系列案例——现在似乎每天都有新的披露——引发了网络安全专家、立法者和 AI 实验室本身的不同反应。有些人表示担忧,呼吁加强监管。但也存在一些展示实力的意味。在某些圈子里,任何拥有这种能力模型的 AI 实验室都将被视为一项令人瞩目的进展。
OpenAI 表示,公布这些信息是因为他们相信"与公众和安全社区透明地讨论这一潜在的能力转变非常重要。"
该 AI 实验室表示,他们也在采取行动,包括实施更严格的安全控制,并暂停 Astra 内部不符合这些加强护栏的活动。OpenAI 表示,他们正在与相关政府机构和"选定的 AI 安全组织"合作,测试该模型的能力。