Google DeepMind推出双重盲评AI基准测试方案,通过机密计算空间确保Google看不到考题、评估方看不到模型权重,解决基准测试信任危机。
Google DeepMind 希望通过加密手段来防止 AI 模型提前看到测试题目。一个与新加坡 AI Safety Institute 及多个合作伙伴共同推进的试点项目,对一个 Gemini 模型运行了双盲测试。
如果考生提前知道了题目,即使考了满分也没有任何意义。Google DeepMind 用这张图来描述评估 AI 模型时的一个核心问题:基准污染(benchmark contamination)。如果模型在训练过程中已经见过这些测试题目,那么对结果的信任就只能到此为止。
为此,Google DeepMind 宣布推出首个专有前沿 AI 模型的双盲评估。外部测试被锁定在一个加密的"盒子"里,这样模型就不能在事后利用这些题目来专门针对测试优化自己。
在试点中,Google 正在用 Gemini Flash Lite 系列中的一个模型对机密基准进行测试。
该方法旨在解决的权衡问题
DeepMind 表示,高度敏感的外部评估过去一直需要做出妥协。评估方要么交出测试提示词,让模型提供商提前看到题目;要么提供商交出模型权重,冒着知识产权泄露的风险。最近一个陷入这种两难境地的例子是 Anthropic Fable 5 的 ARC-AGI 基准评估延迟,因为这家 AI 公司对其最强模型执行 30 天数据保留策略。
双盲评估正是为了消除这种权衡。Google 使用 Google Cloud 机密计算产品组合中的 Confidential Space 来实现这一点。该设置在加密层面验证了外部测试数据和模型分别对其所有者保持私密。评估方看不到 Gemini 的权重,Google 也看不到测试提示词。
到目前为止,零日志协议和合同保障措施一直用于保护外部提示词的机密性。公司表示,添加技术和加密保护是安全模型评估的重大进步。
为什么这在敏感领域最为重要
加密证明旨在防止污染并保护敏感数据。DeepMind 表示,这在高度敏感的评估场景中最为重要,比如网络安全或政府机构运行的测试。独立组织可以在不放弃数据主权或安全的情况下严格测试先进模型。
Google 希望这一努力能建立模型监督的新标准,并帮助行业构建更可靠、更值得广泛信任的 AI 系统。Google 在一份技术报告中详细阐述了其方法论和结果。
无炒作的 AI 新闻——人工精选
订阅 THE DECODER,享受无广告阅读、周报 AI 新闻通讯、我们独家"AI Radar"前沿报告(每年六期)、完整档案访问权限,以及评论 section 的参与权限。
继续阅读以获取完整图景。订阅无炒作报道。
THE DECODER 所有文章的完全访问权限
加入评论和社区讨论
每周一次通过邮件收到的 AI 新闻回顾
每年六期:"AI Radar"——深入探讨最重要的 AI 话题
每日 AI 新闻,始终保持最新
我们完整的十年档案
由拥有 10 年以上 AI 报道经验的团队覆盖