强化 AI 安全框架防范高风险模型
Google DeepMind 升级 Frontier Safety Framework,加强先进 AI 模型的风险识别和缓解能力。
Google DeepMind 升级 Frontier Safety Framework,加强先进 AI 模型的风险识别和缓解能力。
Four Flynn、Helen King、Anca Dragan
我们正在扩展风险领域,并完善风险评估流程。
更新于 2026 年 4 月 17 日
AI 突破正在改变我们的日常生活:从推动数学、生物学和天文学的发展,到释放个性化教育的潜力。随着我们构建能力日益强大的 AI 模型,我们始终致力于以负责任的方式开发技术,并采用以证据为基础的方法,提前应对不断涌现的风险。
今天,我们发布 Frontier Safety Framework(FSF,前沿安全框架)的第三版。这是迄今为止,我们在识别和缓解先进 AI 模型所带来的严重风险方面最全面的方法。
此次更新建立在我们与产业界、学术界和政府专家持续合作的基础之上。我们还吸取了实施旧版框架的经验,并纳入了前沿 AI 安全领域不断演进的最佳实践。
在此次更新中,我们引入了一个专注于有害操纵的 Critical Capability Level(CCL,关键能力等级)*。具体而言,它针对的是具备强大操纵能力的 AI 模型:这类能力可能被滥用,通过与模型持续互动,在已识别的高风险情境中系统性、大幅度地改变人们的信念和行为,并有理由认为这会造成额外的、大规模严重伤害。
这一新增内容建立在我们此前研究的基础之上,并将相关研究转化为可执行机制。此前的研究旨在识别和评估生成式 AI 引发操纵行为的机制。未来,我们将继续投入这一领域,以便更深入地理解和衡量有害操纵带来的风险。
我们还扩展了框架,以应对未来可能出现的情景:失准的 AI 模型可能会妨碍运营方对其运行进行指导、修改或关闭。
上一版框架包含了一种探索性方法,核心是工具性推理 CCL(也就是针对 AI 模型何时开始进行欺骗性思考而设定的预警等级)。在此次更新中,我们进一步制定了适用于机器学习研发 CCL 的规程,重点关注那些可能将 AI 研发加速至潜在破坏稳定程度的模型。
除了这些能力可能被滥用所带来的风险之外,在达到这些能力等级时,模型可能自主采取未经指示的行动,由此也会产生失准风险;而且,这类模型很可能会被整合到 AI 的开发和部署流程中,进一步加剧相关风险。
为应对 CCL 带来的风险,当模型达到相关 CCL 时,我们会在对外发布之前开展安全论证审查。这项工作包括进行详细分析,以证明风险已降低到可管理的水平。对于先进机器学习研发 CCL,大规模内部部署同样可能带来风险,因此,我们现在也将这类部署纳入该审查机制。
我们的框架旨在根据风险的严重程度,采取与之相称的应对措施。我们进一步明确了 CCL 的定义,专门用于识别那些需要最严格治理和缓解策略的关键威胁。在达到特定 CCL 阈值之前,我们会持续采取安全与安保缓解措施,并将其作为标准模型开发方法的一部分。
最后,在此次更新中,我们更详细地说明了风险评估流程。在核心早期预警评估的基础上,我们介绍了如何开展整体评估,其中包括系统性识别风险、全面分析模型能力,以及明确判定风险是否可接受。
自 2026 年 4 月 17 日起,我们在 Frontier Safety Framework 的部分领域中加入 Tracked Capability Levels(TCL,跟踪能力等级),引入一种新的能力等级,帮助我们更早发现并评估极端程度相对较低的潜在风险。
我们还更详细地介绍了完整的风险管理流程,涵盖从初步识别到风险缓解的全过程。
Frontier Safety Framework 体现了我们一以贯之的承诺:随着 AI 能力不断向 AGI 迈进,我们将以科学且以证据为基础的方法持续跟踪 AI 风险,并提前做好应对准备。通过扩展风险领域和强化风险评估流程,我们希望确保具有变革性的 AI 能够造福人类,同时尽可能减少潜在伤害。
我们的框架将根据新的研究成果、利益相关方的意见以及实施过程中积累的经验持续演进。我们仍将致力于与产业界、学术界和政府开展协作。
通往有益 AGI 的道路,不仅需要技术突破,也需要稳健的框架,在前进过程中缓解风险。我们希望,更新后的 Frontier Safety Framework 能够为这项共同事业作出有意义的贡献。
*我们的框架围绕一系列名为 Critical Capability Levels(CCL)的能力阈值构建。当达到这些能力等级时,如果缺乏缓解措施,前沿 AI 模型或系统可能会带来更高的严重伤害风险。