先记住这个答案
Agent 越高自主,意味着其执行路径越不固定、越依赖模型在开放空间中逐步决策。每一次决策都可能有偏差,而后续行动会基于偏差继续推进,错误会像滚雪球一样累积。若不设监督,系统可能偏离目标甚至造成破坏。监督机制(如检查点、人工审批、沙箱)通过周期性校验、暂停和执行限制,提供纠错机会,在不牺牲必要自主度的前提下控制风险。
- 自主性扩大错误影响半径
- 监督需按风险密度部署
- 环境反馈是基本护栏
自主循环中的错误放大机制
Agent 的自主循环可概括为:观察环境 → 推理决策 → 采取行动 → 再观察。高自主意味着每一步的行动选择范围大,而每个决策都基于对前一步结果的解释。若某一步理解偏差,后续的推理和行动都会据此偏移,且缺少外部纠错时偏差可能在多轮后变成不可逆的结果。例如代码修改 Agent 若一开始误解需求,后续所有的文件编辑都会建立在这个错误方向上。
监督机制可以在行动之前检查权限与参数,在行动之后核对真实结果。测试失败或工具报错提供了纠错证据,但反馈本身不会自动阻断错误路径,需要宿主或模型明确处理。对于影响较大的操作,可以设置审批、额度或状态前置条件;这些约束由工具服务执行,不能只写在提示词里。
购物退款 Agent 风险场景
假设某售后系统的业务规则规定:超过 30 天的订单退款需要人工审核,删除账户数据需要用户另行确认。这只是本例设定。一个工单同时要求退款与删除数据,Agent 如果先删除相关记录,之后才发现退款还需核验订单,就可能破坏后续处理条件。执行顺序和每项操作的授权都需要单独判断。
可以让工具服务在退款前验证订单与审批状态,在删除前验证用户身份、具体删除范围和确认记录。确认凭证由可信服务校验,不能由模型自行声明。按这一设计,未满足前置条件的请求应被拒绝或挂起,模型再根据明确错误继续处理;是否达成该效果仍需用越权、重复请求和状态变化用例验证。
监督机制的失效边界与代价
监督并非万无一失。如果人工检查点安排得太频繁,Agent 会因等待反馈而丧失自主优势,甚至退化成半自动工作流;而如果规则引擎只检查固定模式,面对新颖的恶意输入或复杂多步攻击就会失效。例如攻击者可以巧妙拆分危险动作,让每个单独步骤都在规则阈值内,从而绕过检查。这说明静态规则在开放世界不可能穷尽。
分层约束包括工具侧最小权限、隔离执行环境、可撤销操作、预算上限和审计日志。各层防的是不同问题:沙箱限制资源访问,权限校验约束可执行动作,日志帮助定位已经发生的行为。增加模型审核也可能引入新的误判与开销,因此应使用实际失败用例验证效果,并为无法自动判定的情况保留接管路径。
容易答错的地方
- 监督与自主对立不可调和
- 错误认为加了监督就会让 Agent 变得呆板。实际上监督可以设计得不中断流畅执行,例如自动检查点只在异常指标时触发人工。好的监督是可配置、有层级的,能让高自主和安全共同存在。
- 只依赖模型自我校准
- 有些团队相信模型能力够强,不需要外部反馈。但自校准基于内化知识,无法感知真实环境中的意外情况。错误发生在模型未看到的输入上时,没有环境返回的错误信号就无从修正,系统会带着偏差继续运行。
面试官还会怎么问?
既然要监督,为什么不用固定工作流?
工作流适合能预先规定控制路径的任务,也可以包含分支和重试。只有确实需要根据中间结果动态选择步骤时,才值得评估 Agent。监督与选型是两个问题:工作流同样需要权限校验,Agent 也可以在固定边界内自主完成子任务。
如何决定何时需要人工检查?
结合影响范围、可逆性、授权是否明确以及错误能否被可靠检测来判断。公开发布、资金操作或批量删除通常需要更严格的前置条件;读取公开文件可以更宽松。并非所有读取都低风险,涉及私有资料或跨租户资源时仍应校验访问权限。
环境反馈算不算监督的一种?
环境反馈是监督的重要输入,但不能等同于一套完整护栏。它可能延迟、缺失或仅反映局部结果,例如测试通过不代表操作已获授权。系统需要把反馈接入明确的重试、暂停或停止规则,并用权限检查约束实际可执行的动作。
参考资料
示例用于理解所注明的运行环境与边界;延伸学习可结合原文中的更多案例。