用强模型评估弱模型输出是规模化评估的唯一方案,但前提是用几百个人工标注校准 judge 的偏差,之后才能免费运行;与人类专家一致率高于 80% 即可用。
判断力是一种仪器,不是先知
把判断力想象成实验室里的温度计。它有一个读数、一个偏差、一个精度,以及一个它可信的适用范围——这些在用参考标准校验之前都是未知的。参考标准是人类标注。没有捷径可走:如果一个判断力与人类在你的任务上的一致率是未知的,那么它产生的数字的意义也是未知的,无论测试框架打印出多少位小数。
好消息是,标注是一项一次性的成本,只需要几百个人类标签,之后判断力在每次后续评估中基本上是免费运行的。这种权衡正是判断力值得麻烦的原因。
已发布的agreement数据说明了什么
标准参考是 Zheng 等人 2023 年的论文"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena"。在他们的设置中,一个强判断力模型与人类专家偏好的agreement率超过 80%——作者指出这与两个同样比较中的人类专家之间的agreement率相当。这个框架是关键部分:判断力的天花板不是完美的一致,而是人类与人类之间的一致,因为对于真正模糊的条目,人类之间本身就存在分歧。
同一篇论文记录了随之而来的失败模式——位置偏差、冗长偏差、自我增强偏差,以及在数学和推理题目上的弱势(因为判断力必须自己解决问题才能评分)。所以文献的诚实总结是:一个设计良好的通用聊天质量判断力可以接近人类水平的一致率,但它在携带系统性偏差的情况下做到这一点,你必须围绕这些偏差进行设计。这并不能证明你的判断力、在你的评分标准下、与你的标注员在任何特定比率上达成一致。这是必须由你来产出的数字。
设计判断力提示词
判断力提示词以可预测的方式失败,其中大多数通过"比你感觉必要的更具体"来修复。
给出标准,而不是形容词。"评价有用性"会引入判断力自己的审美偏好。"回复是否说明了退款窗口的天数?是否避免了承诺某种结果?是否指出了下一步?"这是可以评分的标准。你可以交给新员工的标准,就是判断力可以应用的标准。
在有参考答案的地方提供参考。参考引导评分——向判断力展示一个已知好的答案——是针对任何有正确答案的问题可用的最大单项改进,Zheng 等人特别推荐用于数学和推理题目,因为无根判断力在这些题目上评分很差。
要求它在评分之前先推理。依次要求:先给出一个简短的论证,然后是裁决。顺序很关键:如果先输出裁决,论证就会被 conditioning 成对裁决的合理化。
约束输出格式。最后一行是 VERDICT: pass 或者一个小的 JSON 对象。解析自由文本获取分数是静默判断力失败的一个来源,这种失败看起来像模型退化。
包含平局选项。如果你的量表没有办法表达"这些是等价的"或"这个条目无法回答",判断力会发明一个区别而不是留空,而你就会把这种发明当作信号来解读。
选择输出量表
最常见的错误是 1-10 量表。十个级别需要共同理解什么将 6 分和 7 分分开,这在人类中都不存在,而且 resulting scores 会聚集在一个狭窄的范围内,极端值几乎不用。你得到的是一个只有一位有效信息的指标,但有很多表面精度。
量表求和选项值得比现在更多的使用。五个是/否标准产生 0 到 5 的分数,比直接 1-5 评分具有更好的agreement,当模型退化时你可以看到是哪个标准移动了。
针对人类进行校准
这个过程做一次,在判断力被信任之前:
采样 150 到 300 个条目,覆盖质量的完整范围。包含故意的失败——一个在 calibration 中从未见过糟糕输出的判断力,恰恰在关键地方是未校准的。
让至少两个人类独立地用与判断力相同的书面评分标准对每个条目进行标注,并首先计算人类之间的标注者间agreement。如果他们彼此不同意,问题是评分标准本身,没有判断力能修复它。
用相同的统计量计算判断力与人类之间的一致性——二元分类用 Cohen's κ,不是原始百分比,因为当某一类占主导时原始百分比agreement会被虚高。
将判断力与人类的一致性与人类与人类的一致性进行比较。大致相等是现实的 success 条件。明显更差意味着评分标准对判断力来说 specification 不足,而不是判断力笨。
保留标注集。它现在是判断力本身的回归测试,当你第一次更换判断力模型时会需要它。
长期运行判断力
将判断力模型固定到特定版本,将更换它视为在实验中途替换测量仪器:重新运行校准集,并意识到历史分数在变化前后不可比较。将温度固定为零。将判断力提示词与评估一起放入版本控制,因为判断力提示词的编辑会移动每个历史数字,这是当指标无缘无故跳跃时首先要检查的。
最后,如果可以避免,不要用被测试的模型作为它自己的判断力。自我偏好是一个有文档记录且可测量的效应,而且修复成本很低。
判断力不需要是你能触及的最强模型,但它需要与候选模型不同,并且在运行中保持稳定——这意味着实际约束是 behind 一个接口提供多个供应商的模型。用一个密钥可触及的范围浏览是找到既不是候选也不是新集成的判断力的最快方式。
判断力偏差:长度、位置和自我偏好
成对比较 vs 绝对评分
人类评估:当你仍然需要人时