企业级AI Agent需要用置信度过滤代替全量人工审核,高危操作才送人类判断,轻量改动直接执行并记录日志。UI上展示diff而非全文,让审查秒级完成。
第一部分以一个坦白结尾:永远无法通过测试达到 100% 正确率。对于关键工作流,最终的安全网是人。但"人在循环中"有一个不为人知的秘密——设计得不好,它就只是做做样子。
把每个 Agent 操作都路由给人审批,看看会发生什么。第一周,认真审查。到第三周,审批疲劳来了,人们以思维的速度点击批准。你花着人的工资让人变成了一个回车键,而这个循环提供的监督实际为零。
目标不是让人审查所有事情。而是让人审查那些真正需要判断的事情,而且量是他们能持续承受的。
先过滤,再路由。置信度阈值决定谁看到什么:高置信度的日常操作直接执行并记录日志;中等风险的中置信度操作进行抽样;真正不确定或高影响的操作才交给人。这里面的 UX 设计细心一些,就能把人需要处理的量控制在有限范围内。这才是整个游戏的关键。
展示差异,而不是文档。没人会重读一份生成的合同。展示相比模板改变了什么,高亮模型填写了哪些字段,让偏差一目了然。审查一个差异只需要几秒;审查一页文档需要几分钟,而几分钟在第三周是撑不下去的。
用 LLM 抽样,用人确认。每天用 LLM 审计员对随机抽取的自动化输出打分。分数走低?自动提高人工审查率。这是你在不增加审查部门的情况下捕获静默漂移(第四部分最可怕的一种失效模式)的方式。
┌─────────────────────────┐
│ Agent output │
└────────────┬────────────┘
▼
confidence + impact triage
┌──────────────────┼──────────────────────┐
▼ ▼ ▼
high conf, medium stakes low conf or high stakes
low stakes LLM-sampled audit human review, diff-based UI
auto-execute trend monitoring │ like / unlike
(logged) │ trend drops ▼
└──────────────► feedback loop back into evals
关闭循环。每一个赞、踩和人工修正都是标注数据。把它反馈到第二部分的评估套件中。你的审核员不只是在把守关卡,他们在持续构建你的回归测试。
有一件事要停止做:对一切进行 100% 人工审查。这看起来很安全,但产生的是橡皮图章,并把真正的失败隐藏在噪音中。监督是一种预算。花在真正需要判断的地方。
这完成了系列的闭环:约束工作流,只购买你需要的智能,保护凭证,为失败而工程化,把人放在人真正能创造价值的地方。这些都不需要更聪明的模型。都需要精心的设计。
选一个你系统中的审批队列。测量有多少比例被批准、多快、被谁批准。如果每个审批耗时不到五秒,你没有监督,只有橡皮图章。这个月就用过滤和差异展示来重新设计它。