先记住这个答案
BLEU/ROUGE 基于 n-gram 精确匹配,忽略语义等价和事实一致性,高分会来自词汇巧合而非优质摘要。同义改写、信息遗漏或编造都可能获得相近分数。上线前需用人工侧写或补充评测覆盖这些维度,否则会误放行劣质模型。
- BLEU/ROUGE 只测词汇重合,不测语义等价。
- 高 n-gram 得分无法识别事实编造。
- 上线需补充语义与事实维度的人工侧写。
n-gram 重叠如何掩盖语义差异
BLEU 和 ROUGE 通过计算候选摘要与参考摘要之间的 n-gram 重合率来打分。ROUGE-N 统计召回侧词汇覆盖,BLEU 统计精确率侧。两者都依赖表面词形匹配,不建立词汇到概念的对齐,因此无法判断两个词是否同义、是否指代同一实体或事件。
若一个模型把“警方逮捕了嫌疑人”改写为“警察抓住了罪犯”,字面重合降低,但语义相同;反过来,若候选含“嫌疑人被释放”但参考是“嫌疑人被拘留”,一个词变化可能让 n-gram 局部仍高,却完全错事实。这使分数无法反映真实质量。
新闻摘要改写的评测陷阱
假设团队开发一个新闻摘要模型,离线集有参考摘要。模型 A 用转述风格,把“公司宣布裁员10%”改成“企业确认削减十分之一员工”,ROUGE-L 仅有 0.31;模型 B 直接复制原文短语,ROUGE-L 为 0.52,但遗漏了关键数字,并把“盈利下降”编成“亏损”。若只以 ROUGE 为准则,模型 B 会被选上线,实则制造了事实错误。
在一个实验中,测试 200 条新闻,比较 ROUGE 分与人工评分相关性,发现 ROUGE 对同义改写平均惩罚 40% 的分数,而对编造事实不加惩罚。因此需要人工对事实性和完整性打分,并单独统计“编造事件数”,与 ROUGE 一同作为门禁。
纯 n-gram 指标失效的条件
当摘要要求抽象概括而非抽取关键句时,模型输出的词序和表面对基本与参考不同,ROUGE 会系统性低估质量。尤其在金融、医疗等对数字与实体敏感领域,一个数字错误可能完全改变语义,但 n-gram 重叠可能因为其余部分相同而给出高分。
对策是采用分层评估:先跑 ROUGE 做回归测试,再对候选集合子集进行人工打分,重点检查“事实错误率”和“无关信息比例”。人工成本高则用 LLM-as-judge 辅助,但必须定期校验与人工一致性。若预算有限,优先抽检生成中高风险样本,而不是均匀抽样。
容易答错的地方
- 认为 ROUGE 高就代表摘要质量高
- ROUGE 高可能因为过度复制原文,但摘要要求凝练和改写。真实案例中复制型摘要 ROUGE 很高却让用户反感。正确做法是同时检测重复度与信息冗余。
- 只用 ROUGE 做开发集筛选
- 开发集可能被模型过拟合,提升 ROUGE 并不提升事实性。需要保留隐藏测试集并人工标注事实。否则会陷入分数虚高而实际产出不可用。
面试官还会怎么问?
人工侧写应包含哪些维度?
至少覆盖事实一致性、信息完整性、可读性和相关性。用 1-5 分或错误计数,并定义好“编造”与“过度概括”的边界。
能否用 BERTScore 完全替代 ROUGE?
不能。BERTScore 对语义相似敏感,但仍无法捕获事实错误,尤其当编造句子嵌入与参考近似时。需要额外检查实体和数字一致性。
如果算力有限,如何最小化人工成本?
分层抽检:先按 ROUGE 但采用不确定性采样挑选模型低置信样本,或对线上真实输入采样。设置最少 200 条,关注高影响类别。
参考资料
示例用于理解所注明的运行环境与边界;延伸学习可结合原文中的更多案例。