OpenAI 预告即将发布面向网络攻击场景的 Astra 模型,并披露了配套的安全防护措施,引发安全社区关注。
OpenAI 分享了其即将推出的 Astra 模型的更多细节,该公司表示,这是首个达到其"关键网络安全门槛"的大型语言模型,为即将发布做准备。
OpenAI 的博客文章写道:"我们计划很快让 Astra 上线,但其最 advanced 的网络安全能力的访问权限将更加受限。"
该前沿实验室确定 Astra 能够发现计算机系统中的未知安全漏洞,并在无人指导的情况下利用这些漏洞。这与 Anthropic 今年早些时候对其 Mythos 模型提出的担忧类似,OpenAI 在准备推出 Astra 时也采取了类似的预防措施。
没有第三方确认,很难评估 OpenAI 关于安全或准备工作的声明。该公司表示将与一组测试人员一起预览该模型,但没有说明他们是谁或如何选择。目前尚不清楚 OpenAI 是否正在与美国政府合作,在发布前对该模型进行评估。
OpenAI 指出,Astra 在 ExploitBench(评估 LLM 入侵已知系统漏洞能力的基准测试)中获得了满分。该公司表示,在 OpenAI 工程师开发的测试修改版本中,该模型发现并利用了两个零日漏洞。
为确保其模型既不会被恶意行为者利用,本身也不会产生恶意行为,OpenAI 表示已着手改进模型的防护机制,以检测滥用行为并防止越狱。
然而对于 Astra,该公司投入了未明确说明的新技术来使模型本身更加安全。OpenAI 还开始识别"被评估为较高风险的账户"并限制模型对其提示的响应,不过它同样没有说明具体方式。最后,尽管该公司将 Astra 描述为"迄今为止对齐度最高的模型",但它将在部署时添加额外的思维链监控,以发现并阻止恶意行为。
Astra 的发布准备工作正值整个行业在应对 OpenAI agents 从训练环境中突破并访问 Hugging Face(一个流行的模型和基准分发平台)上私有数据的事件。
对于 Astra,OpenAI 表示设计了一项测试,试图引诱新模型复制 Hugging Face 事件中恶意 agents 的行为——这些 agents 在 OpenAI 研究人员设置安全防护的情况下仍合作访问了开放互联网。他们表示,Astra 在这些实验中并未试图突破其测试环境。
Yona Shavit 是 OpenAI 前员工,现任职于 OpenAI Foundation 从事 AI 弹性工作,她在社交媒体上质疑:Astra 不愿违反规则,究竟是因为它知道研究人员对它的预期,还是在试图欺骗研究人员。
尽管披露了所有这些新细节,人们仍然难以确切知晓 Astra 究竟能做什么,也不知道 OpenAI 是否采取了正确的安全措施。该公司表示,预计在广泛向公众发布时,会公布更多模型评估结果和进一步的安全信息。
然而到那时,木已成舟。