用强模型按评分规则评估弱模型输出的技术框架,关键要点包括:制定具体评分规则、用pairwise比较、验证judge与人工标注的一致性。
LLM-as-judge 借助一个能力强的模型,对 Agent 的输出按评分标准进行打分或比较——填补了质量评判开放式且人类判断无法规模化的问题。
做得好,它能以极低的成本和人力近似人类判断;做得差,它会产生自信满满的系统性废话。关键在于:具体的评分标准、 pairwise(成对)比较优于绝对评分、以及用人类标签验证 Judge。
很多最重要的质量——有用性、忠实性、推理质量——都没有公式可言,而人类判断在每次变更需要评估成千上万案例时无法规模化。用一个能力强的模型当 Judge 填补了这个缺口:让一个模型按评分标准对输出进行打分或比较。做得好,它能以极低的成本和人力近似人类判断;做得差,它会产生自信满满的系统性废话——这就是为什么下面的细节很重要。
用模型来评估模型看似循环——如果 Judge 能可靠地分辨好坏,为什么不直接用它当 Agent?答案是判断比执行更容易。判断一个答案是否忠实于来源,比生成一个忠实的答案范围更窄、约束更强,就像检查一个证明比找到一个证明更容易。Judge 被给予输入、输出和评分标准,只需按该标准进行评估。
评判的质量几乎完全取决于评分标准。模糊的"1-10 分"指令产生的是噪声;明确定义每个等级和观察点的具体评分标准才能产生可用的一致性。Judge 的可靠性来自于评分标准提供的结构。
judgment = judge_model(
task=original_input,
response=agent_output,
rubric="""Score faithfulness 1-5.
5 = every claim supported by the sources.
3 = mostly supported, minor unsupported detail.
1 = key claims not supported / contradicted.""",
)
Free Agent Evaluation QuickStart — the whole loop (define, measure, test, trust) on a few pages. Download it free.
模型在比较时比抽象评分更可靠。问"这两个回答哪个更好?"往往比"1-10 分"一致得多,因为绝对分数会漂移和聚集,而比较是有锚定的。只要你能把评估框架为比较——与参考答案对比,或在 Agent 的两个版本之间对比——你就能得到更可靠的信号。
问哪个更好,而不是有多好。
位置偏差 — Judge 可能偏好排在前面的答案;调换顺序并取平均来抵消。
冗长偏差 — Judge 常常偏好更长的答案,不论质量如何;在评分标准中明确指出。
自我偏好 — Judge 可能偏好自己模型家族的输出;当 Judge 和 Agent 使用同一模型时要注意。
验证 Judge — 在样本上用人类标签检查它。未经验证的 Judge 只是一个观点,不是测量。
Going deeper? AI Agent Evaluation & Testing: The Complete Guide is the full reference — 40 pages, 15 chapters, 5 appendices, with a worked support-agent example and a 30-day adoption path. Get the guide.
用能力强的模型按评分标准对 Agent 输出进行打分或比较,替代规模化的人类判断。这是评估有用性、忠实性等开放式质量的主力方法,这些质量没有公式。
谨慎使用的话可以:具体评分标准、pairwise 比较优于绝对评分、用人类标签验证。没有这些,它会产生自信但系统性的错误。未经验证的 Judge 是观点,不是测量。
模型比较两个输出的能力比单独评分更一致。绝对分数会漂移和聚集;比较是有锚定的。把评估框架为"A 和 B 哪个更好?"能产生更可靠的信号。
位置偏差(偏好第一个答案)、冗长偏差(偏好更长的答案)、自我偏好(偏好 Judge 自己的模型家族)。通过调换顺序取平均、在评分标准中指出长度问题、用人类验证来对抗它们。
在样本上用人类标签验证它。如果 Judge 的分数跟踪人类判断,你可以在规模化时信任它;如果不是,就修复评分标准。未经验证的 Judge 可能在你不自知的方向系统性错误。
For further actions, you may consider blocking this person and/or reporting abuse