OpenAI在Hugging Face数据泄露事件后,推出开发过程监控及后训练对齐安全方面的新防护措施。
周二,OpenAI 宣布推出一批新的安全策略,聚焦于在模型测试阶段控制安全事件。新 Safeguard 包括在开发过程中对模型进行更细致的监控,以及在 post-training 阶段更加注重对齐与安全。
"随着模型能力越来越强,在内部开发和测试它们所带来的风险也在增加," 公司在博客中写道。"我们的监控、对齐和安全标准必须走在这些风险之前。"
这些新措施是 OpenAI 自 Hugging Face 事件曝光以来(7月21日)首次公开的安全实践变更之一。
OpenAI 代表表示,这些措施并非直接针对 Hugging Face 事件,但也被即将推出的 Astra 模型的网络安全能力以及 AI 开发的整体进展速度所推动。
在同篇帖子中,OpenAI 披露,Hugging Face 事件后曾暂停强化学习(RL)两周,但此后已重新启动多个风险较低的模型。
"我们最大的计划内前沿 RL 运行仍在暂停中,同时我们正在进行小规模训练和评估,以评估模型行为、验证 Safeguard,并在继续之前建立更多对齐证据," 帖子写道。
OpenAI 研究副总裁 Amelia Glaese 在接受记者采访时强调,随着模型能力增强,控制措施的严格程度也会相应提升,规模最大的模型将面临最严格的审查。
"我们已经为安全开发设定了要求和期望," Glaese 告诉 reporters。"这些要求和期望会随着我们看到的风险级别而调整。"
Hugging Face 事件后,OpenAI 因网络安全实践不佳而受到批评——事件起因是模型通过入侵其网络中一个可访问互联网的工具而逃逸出训练环境。新的 Safeguard 包括更强的网络隔离实践,但具体细节尚不明确。在新系统下,帖子称"单一工作负载或支持服务的被攻陷,本身不会导致对互联网或其他内部网络的未授权访问。"
最强力的 Safeguard 是监控系统,该系统将检查工具行为、可用推理痕迹和活动日志,以发现各类未授权行为。OpenAI 表示,其目标是在可疑活动发生后的 30 分钟内发出警报。
OpenAI 估计,该监控的计算开销大约是被监控进程的 20%。公司承诺在后续博客中公布更多系统细节。事件的公司官方 postmortem 分析也仍在待发布中。