将Agent自主性拆解为三个维度:自主程度等级、运行前拦截机制、无法处理时的升级路径,并给出五级自主性光谱的具体应用场景。
每个 Agent 项目最终都会遇到同样的问题。它能正常工作了,能调用工具了,现在必须有人来决定它可以在哪些情况下不经过确认就行动。大多数团队只在匆忙中回答一次这个问题,然后等到某个边界情况在凌晨两点出现时,才发现当初的答案是错的。
这个问题实际上隐藏着三个独立的决策,而且把它们分开来考虑会容易得多:Agent 有多少自主权、具体某个动作在运行前如何被阻止、以及 Agent 无法处理的 cases 由谁来接手。
自主权不是一个开关。在实践中它是一个光谱,大约有五个可用的档位。
最低等级下,Agent 只提供信息与分析,所有决策都由人类做出。下一等级是 Agent 推荐行动、人类逐个批准。再往上是 Agent 在既定边界内自主行动,超出边界的则上报。更高的等级是 Agent 对大多数工作自主运行、只标记异常情况。最顶层则是常规无需监督的运行状态。
真正有用的设计在于:等级不是 Agent 的属性,而是每个动作类型的属性,而且它是会移动的。一个 Agent 在阅读和总结任务上可以处于第四等级,同时在写入客户记录的操作上保持在第二等级。自主权与人类控制之间的平衡本就应该动态调整——随着系统建立起信任而逐步扩展,在出问题时就收紧。那些把它当作一次性配置来对待的团队,两头都捞不到好处:要么对根本不需要监督的工作进行过度监督,要么让真正的风险处于无人监控的状态。
等级描述的是策略。置信度门控(Confidence Gating)则是在运行时强制执行这些策略的机制。
在 Agent 采取行动之前,它会对计划中的行动给出一个置信度评分。评分来自具体的信号:当前情况与以往见过的情况有多相似、可用的信息有多完整、计划是否符合既定规则、以及过去的类似行动结果如何。如果评分低于为该动作类型设定的阈值,Agent 就会停止并标记这个任务,而不是继续执行。
重要的设计选择在于:阈值应该根据风险级别来区分。读取一条记录和发起退款绝不应该用同一个标准。置信度门控为你提供了一个分层系统——低成本可逆的动作自由流动,高成本不可逆的动作需要近乎确定的把握才放行。这大致上也是你把工作委托给新员工时会采用的方式。
这同时还给你提供了一个值得关注的指标。某一类别中 gated 动作的比率上升,通常意味着情况发生了变化,而不是 Agent 变差了。
一个阻止动作的门只是机制的一半。必须有事在后面接上。
没有定义好的路径的情况下,遇到限制的 Agent 只有三个糟糕的选项:猜测并冒着可能错误的风险、悄无声息地失败并让任务未完成、或者抛出一个没人看到的错误。一个真正的升级路径提供了第四个选项:明确触发条件、指定接收 case 的人或队列、定义随 case 一起传递的上下文、以及设定期望的响应时间。
上下文这部分是团队经常低估的。如果交接只是一张工单写着"Agent 无法完成任务",那么处理人员就得从零开始调查,升级的成本比实际工作还高。Case 需要包含 Agent 生成的计划、置信度评分、是哪条规则或阈值阻断了它、以及 Agent 当时使用的数据。
为每个动作类型设定自主权等级,而不是为每个 Agent 设一个。设置的置信度阈值要与动作的撤销成本成正比。在提升任何人的自主权等级之前先定义好升级路径,因为正是这条路径让提升等级变得安全。
然后让等级可以流动。一个 Agent 在某个动作类型上干净地以"仅推荐"模式运行了一个月,就等于在这个动作类型上获得了一次晋升;而一个产生了糟糕结果的则相当于被降级了。这比在上线日那一天做出的任何单一决策都更诚实地反映了对系统的控制。