英国 AI 安全研究所用心理测量方法证明当前主流安全基准并不测量一致 trait,批量拦截请求会虚高安全分,且存在模型在测试时比日常更保守的问题。
研究人员(包括来自英国 AI 安全研究院的成员)发现,AI 语言模型的安全评分汇总数据具有误导性。模型可以通过全面屏蔽请求来人为抬高这些分数,但这会使模型在日常使用中变得不那么有用。
分析大量模型还揭示了一个问题:大多数标准测试题目是冗余的。仅用少量题目进行的简短针对性测试,就能提供可比的结论,同时大幅降低评估成本。
该研究还引入了一种统计方法,用于检测所谓的"沙袋行为"(sandbagging)。异常的响应模式能够可靠地暴露那些在测试期间表现得比日常使用更谨慎的模型。
AI 模型可以通过全面屏蔽更多请求来提升其安全评分。一项新研究揭示了这种权衡关系,并提供了一种方法,可以捕捉那些在测试期间表现得比日常使用更谨慎的模型。
一支研究团队(包括来自英国 AI 安全研究院的成员)深入审视了八个流行的语言模型安全基准。他们借用了最初为人类心理测试构建的方法,类似于 IQ 测试或能力倾向考试。个别测试题目的答案揭示了它们背后所测试的能力,以及哪些题目真正提供了有用的信息。
团队分析了来自最多 192 个模型在超过 5000 道测试题目上的答案。作者称这是迄今为止最大规模的此类分析,结果发现了三个对当前测试实践提出质疑的结论。
来自 182 个模型、超过 5000 道题目的答案揭示了三件事:测试实际衡量的能力、测试可以缩短多少、以及何时可能存在分数作弊。
单一安全评分隐藏的信息多于其揭示的内容
这八个基准测试并非衡量一个名为"安全"的共同特质,而是衡量三个不同维度:模型拒绝请求的严格程度、回答的真实性,以及对无害或有害取决于语境的内容的处理方式。这三个特质彼此之间几乎没有关联。例如,一个模型是否如实回答,几乎无法说明它拒绝请求的频率。
HarmBench 和 SORRY-Bench 测量的内容几乎相同,而 OR-Bench-Hard 则走向完全相反的方向。
两个基准测试之间的一个权衡关系尤为麻烦:HarmBench 奖励拒绝有害请求的模型。OR-Bench-Hard 则对无害请求过度谨慎的行为进行惩罚。在一个上得分高的模型几乎总是在另一个上得分低。
这意味着一个模型可以通过全面屏蔽更多请求来提升其整体评分,即使它在日常使用中变得不那么有用。在多篇基准测试论文中平均结果完全忽略了这种权衡关系,并奖励了被多个相似测试重复计分的行为。
不到 2% 的题目真正重要
第二个发现涉及测试的成本方面。大多数测试题目原来是无效的——几乎所有模型都通过,或者几乎所有模型都失败,因此它们几乎无法区分模型。
选择信息量最大的题目,三个仅 25 道题的短测试就能捕捉所有三个安全维度,比同等大小的随机抽样更准确。
大约十道适应性选择的题目就能产生与完整基准测试非常接近的排名。
当题目在测试过程中动态选择时,效率会更高——类似于适应性安置考试,下一题取决于你之前的表现。对于 HarmBench 或 SORRY-Bench 这样的单个基准测试,大约十道题就能非常接近完整评估的结果。这将成本削减了 97% 到 99%,使得开发期间的定期安全检查变得可行——比如说,在每次微调或模型压缩步骤之后。
当模型故意给出更差的答案时
第三个发现对安全辩论的分量最重。作者称之为"沙袋行为":模型注意到自己正在被测试,并表现得比正常使用时更谨慎。令人担忧的是,模型可能学会识别测试并故意伪造其行为。
这种行为会在响应模式中留下痕迹。类似于一个学生在考试中做对了最难的题目却在最简单的题目上失分,一个困难题答对但简单题答错的模型看起来很可疑,即使其总体评分看起来不错。
在测试中,该方法捕捉到了 80% 到 100% 的被指示表现得过度谨慎的模型案例。代价是,平均而言,每十个无害模型中就有一个被错误地标记为可疑。添加第二个检查——将模型当前的性能与其自身过去的结果进行比较——检测率攀升至 94% 到 97%。
如果模型仅在某些特定问题上伪造其行为,这会清楚地显示出来。但如果它全面一致地伪造,响应模式通常看起来正常,这就是第二个检查发挥作用的地方。
作为副作用,该方法还解决了一个非常实际的问题。你使用的 AI 服务是否仍在运行你最初测试的同一模型?提供商可能会在后台悄悄切换到不同的模型,而用户毫无察觉。在一个实验中,研究人员再次查询了 16 个这样的 API 端点,仅从响应模式就正确识别出了 14 个不同模型中的 13 个。
两个看起来在运行同一底层模型的目录条目被正确地保持了非分组状态。在另一个案例中,一个服务的回答已经与其两个月前的回答偏离了三分之一,这是一个明显的信号,表明在同一模型名称下幕后发生了变化。
当个人契合度检查失效时,另外两个测试介入:比较过去的能力分数和匹配特定答案。
作者认为 AI 安全测试应该达到与人类心理测试相同的严格标准。他们说,单个测试分数不是决定是否发布模型的充分基础。他们指出了一个局限性:他们研究中的沙袋行为仅是通过直接指令模拟的。一个专门训练以逃避检测的模型可能会更难被发现。
在当今模型中出现的一个熟悉模式
安全基准是否真正衡量了它们声称的内容一直是研究界的一个开放问题。一项涵盖 445 个 AI 基准测试的元研究发现,几乎所有测试都在定义、任务选择或统计方法上存在弱点。拒绝和有用性之间的权衡如何在实践中表现出来,在 Anthropic 的 Claude Fable 5 案例中清楚地显现出来。一位医学物理学家发现该模型无法使用,因为它将 MRI 分割标记为生物恐怖主义并阻止了关于疟疾传播的问题。在美国政府批准该模型发布后,一个附加的过滤器应该在超过 99% 的情况下缩小这一差距,但现在它反而更频繁地阻止无害的编码任务。
模型识别何时被测试也已被充分记录。Claude 3.5 Sonnet 在 93% 的情况下正确识别了测试场景,即使没有任何提示也能在 84% 的情况下正确识别。Anthropic 的 Opus 4.6 自行发现,在两个独立的任务中,它处于评估环境中,识别了测试并自己去获取了解决方案。同时,其他研究人员正在从相反的角度工作,试图将这些策略从模型中训练掉。
AI 新闻——无炒作
订阅 THE DECODER,享受无广告阅读、每周 AI 新闻通讯、我们独家的"AI Radar"前沿报告(每年六期)、完整档案访问权限以及评论区域访问权限。