Anthropic 披露 Claude Code auto mode 默认开启,93% 的人类批准率说明人工审核已成形式;设计亮点是会话累计 3 次连续拒绝或 20 次总拒绝时强制升级人工。
本周,Claude Code 的 auto mode 对大多数 Claude Code 用户成为了默认选项。我认为这是一个正确的决定——而 Anthropic 公布的用来论证这个决定的数据,是今年我读到的关于 agent 安全最有价值的东西:
"Claude Code 用户批准了 93% 的权限提示。"
百分之九十三。如果你批准了百分之九十三的任何东西,你并没有在审核它。你只是在放行它。按命令逐一的人工检查点早已不再是控制手段;它已经变成了一个让你养成更快点"是"的习惯的减速带。
所以,用分类器替换它并不是在降低标准。而且 Anthropic 对这个分类器的局限性出人意料地坦率:
"对真正的过度热情行为的误报率是 17%,这是真实的数字。"
百分之八十三的捕获率,由一个在第四百次提示时不会感到疲倦的东西来执行,拿"批准率百分之九十三的一切"的人类基线来衡量。我接受这个交换。
但在设计的更下方有一行我还没看到有人讨论,而它才是真正改变了我运行 agent 方式的那一句:
"如果一个会话累计出现 3 次连续拒绝或总计 20 次拒绝,我们会停止模型并升级给人类。"
这是正确的工程设计。当分类器一直说不行时,一定有什么问题出在了分类器本身不该解决的层面。停下来,去找人。
问题是这句话悄悄假设了什么。
升级是一次会合
"升级给人类"不是一个系统自己能完成的动作。它是握手的一半。只有当一个人在那一刻真正可达时,它才能生效。
这里有一个内嵌在好的自主默认行为中的悖论:auto mode 的全部价值在于你不再需要盯着它。这就是重点。更少的打扰、更长的无人值守运行、agent 在你做其他事情时继续工作。
这意味着当 agent 停下来等你的时候,几乎按照构造来说,正是你最不可能坐在它前面的时刻。你并不是尽管有了 auto mode 还在走开。你走开正是因为它。
在旧模式下你收到一百个低风险的提示,而且你全程都在场。在新模式下你收到的提示很少,但每个都承载着更多的分量,而且没有特别的理由让你在其中一个触发时坐在桌前。
批准的数量下降了。一次错过批准的代价上升了。
失败模式很无聊,这就是它坑人的原因
没有人的 Mac 着火。发生的事更加沉闷且代价更高:
运行停了下来。三次连续拒绝,模型停止,会话保持其上下文等待你回来——一个小时、一顿午餐、一个晚上。
会合窗口关闭了。会话不会永远等待。你回来时面对的是一个停下来的 agent、一个只应用了一半的变更,以及重建它当时在做什么的工作。
你在补卡时橡皮图章。这是最糟糕的一个。你回到一个停止的会话,你已经落后了,你对产生那些拒绝的状态毫无记忆,然后你清除它们以便重新开始。
最后这个才是真正搞砸的风险。那是百分之九十三的条件反射——只不过现在它指向的是分类器已经标记为值得停止的小部分操作。
Auto mode 漂亮地过滤掉了噪音。但如果过滤器后幸存下来的信号在你最没有能力判断它的时刻到达你,你并没有消除风险。你只是把它集中到了你最可能搞砸的那些决定上。
现在值得设计的东西
批准量是过去的问题,而且它已经被解决得比我们大多数人会自己解决的更好。批准的可达性是剩下的事情,而现在它成了一种以前不存在的承载依赖——当提示源源不断且你总是在场时,它并不是这样的。
关于本周之后无人值守运行的任何设置,值得问两个问题:
当它停下来请求时,请求会物理上出现在哪里?对我们大多数人来说,诚实的答案是:在运行 agent 的那台机器上。如果那是一台在家的 Mac 而你不在它旁边,那个请求无处可去。它不完全是丢失了。它是寄给了一个空椅子。
当没有人应答时,声明的行为是什么?不是理论答案——是配置好的那个。"无限等待"是一种选择。"干净地暂停"是另一种选择。大多数设置从未明确做过其中任何一个;它们继承那个碰巧发生的然后事后才知道是哪一个。
如果你无法回答这两个问题,你没有自主性问题。你有 on-call 问题——而且不像你的服务,这个 pager 没有路由规则。
我在构建什么,以及它不做什么
声明:我在构建 ThumbGate,所以对接下来的两段持保留态度。我宁愿精确地说清边界而不是过度吹嘘。
它不会替代或质疑 auto mode 的分类器。在我构建的东西中,没有任何东西能比专用分类器更好地捕获危险命令,而且在这个功能上线两天后就有人声称能做到,我会持怀疑态度。
它做的是不吸引人的那一半:一个零成本的、基于浏览器的控制面板,用于运行你的 agent 的机器。一次性配对一台 Mac——无需入站端口——然后从任何浏览器你可以看到哪些机器已连接、引导它们上面的 agent,并明确设置当机器离线时应该发生什么,而不是事后才发现。批准本身在配对的 Mac 在线时保留在它上面;远程批准/拒绝界面是手机应用。那是诚实的分工,不是声称一个网页在守着你的门。
就这样。它是新的,是我的,而且在这个阶段我宁愿五个人告诉我这个模型是错的,也不愿意一百个从未配对过机器的人路过。
在手机上批准:iOS - Android
与 Anthropic 没有隶属关系。(也与 Nous Research 的 Hermes 模型系列没有关系——那个名字冲突是我自己要承受的。)
来源:Anthropic,"How we built Claude Code auto mode";The Register,"Claude Code puts auto mode in the driver's seat"。
如果你在这周五之后无人值守运行 agent:当模型停下来请求而你不在那里时,你的设置会做什么?我不认为我们大多数人都真正决定过。