先记住这个答案
开放式任务的量规应先列出少量独立质量维度,再为每个维度定义可观察证据和清楚的分档标准。把不可接受的关键错误设成单独门槛,避免被文风等软分抵消。评分时要求指出具体产物或轨迹依据,信息不足时允许无法判断。量规上线前用多份不同质量的样本校准,并分析人工与模型评分的分歧,不能仅用一句整体质量如何让模型随意打分。
- 维度对应用户要求,分档对应可检查的证据
- 关键失败单独判定,不被其他维度的高分掩盖
- 允许未知并记录理由,用分歧样本改进量规
先从任务要求拆出评分维度
假设 Agent 交付一次性能排查报告,可以分别评价证据支撑、原因分析和改进可执行性。证据支撑看结论是否能对应测量,原因分析看是否区分相关与因果,可执行性看建议是否说明修改对象及验证方式。不要同时设置多个含义相近的全面、完整、充分指标重复加权。
对必须满足的要求单列门槛。例如报告引用不存在的测量结果,应明确标记事实错误,而不是让排版与语言分把总分抬过线。权重表达业务取舍,不能替代对严重失败的判断。
为每档分数写出可辨认的表现
可执行性可以设置三档:只有笼统建议;指出修改位置但缺验证办法;说明具体修改、适用条件和验证方式。评审者应引用报告中的对应段落,而不是凭读起来专业的感觉打分。也可以准备各档样本,帮助解释边界情况。
评分器只能依据实际拿到的材料。若没有提供测试日志,就不能推断测试通过,也不能断定根本没测试;应分别记录交付证据不足和实际执行状态未知。需要检查工具副作用的维度,应接入客观检查结果,而不是让模型猜。
通过分歧校准量规
找几份高、中、低质量以及容易误判的产物,让评审者独立评分,再讨论差异来自标准含糊、证据缺失还是专业判断不同。修改量规后保留版本,并用同一批样本重新比较。模型评分也需要这种校准,换模型或提示可能改变分数分布。
使用成对比较时可以交换展示顺序检查位置偏差,避免较长答案总被当成更好。实际报告最好展示各维度与关键失败,总分只作为概览。量规稳定后仍要抽查边界样本,防止系统学会满足表面格式却没有改善任务质量。
容易答错的地方
- 只写专业、清晰、优秀等形容词
- 这些词不能稳定地区分相邻档次,应说明可见行为和证据,例如是否给出可执行验证步骤。排查“AI Agent 开放式任务评分量规 rubric 设计”时还要核对输入、版本和执行顺序,并用反例确认修复后的边界。
- 没有证据也要求必须打分
- 强迫评分容易把猜测变成确定数字。应允许未知,并明确需要补充哪类材料才能继续判断。排查“AI Agent 开放式任务评分量规 rubric 设计”时还要核对输入、版本和执行顺序,并用反例确认修复后的边界。
面试官还会怎么问?
维度越多越全面吗?
过多且相关的维度会重复计分并增加不一致。优先保留直接影响用户价值且可区分的少量维度。针对“AI Agent 开放式任务评分量规 rubric 设计”,还应保留最小复现、预期结果和失败路径,避免只凭一次现象下结论。
所有维度都可以交给模型评审吗?
能通过运行、结构或状态检查判断的部分优先直接检查,模型更适合处理开放式表达和综合质量,并接受人工校准。
怎么防止漂亮格式骗过量规?
为格式良好但事实错误、很长却缺关键步骤等反例准备样本,要求评分理由引用实质内容而不是表面特征。
参考资料
示例用于理解所注明的运行环境与边界;延伸学习可结合原文中的更多案例。