新会话默认切换auto模式,模型自行判断不可逆/破坏性操作并拦截;Anthropic数据显示auto模式阻止89%危险操作,用户手动审批仅阻止13.6%。
2026 年 8 月 14 日,Auto Mode 成为 Pro、Max 和 Team 计划中新 Claude Code 会话的默认权限模式。Agent 不再在每个步骤前询问用户,而是直接继续执行,除非它要采取的操作被判定为不可逆、具有破坏性或指向您当前环境之外的内容。Anthropic 为这一变更提出的论据来自其自身测试数据:在一项包含 1053 个操作的研究中,Auto Mode 阻止了 89% 的有害操作,而通过点击批准提示的人类仅能 catch 13.6%。这个数据令人不安的另一半是原因所在——用户习惯性地批准了他们所看到的 97% 的提示。
如果您使用过编码 Agent 超过一周,您就已经熟悉文章所描述的这种感受。提示不再是决策,而变成了一次按键。Anthropic 将这种现象称为"许可疲劳",并正在论证:由模型对照策略检查每个操作,比一个已经停止阅读的人类做 guard 要更好。
三件事同时成立,但在大多数报道中它们被混为一谈。
第一,默认值仅针对 Pro、Max 和 Team 上的新会话翻转。现有会话保持其当前运行的模式。
第二,Auto Mode 不是"批准一切"。被归类为不可逆、具有破坏性或针对您当前环境之外内容的操作仍会停止并等待您。删除数据、强制推送覆盖历史、以及联系您没有为 Agent 指向的远程系统,这些都是仍会弹出提示的操作形态。
第三,此次发布附带两个比默认本身更值得关注的控制项:针对传入内容的提示注入筛查,以及您可以配置的硬性拒绝规则——无论模型得出什么结论,某些操作永远不会被执行。拒绝规则是值得您花一下午去配置的部分。它是列表中唯一一个其行为不依赖模型判断的控制项。
阻止了 89% 意味着还有 11% 没被阻止。在单个操作层面,这相对于人类的 13.6% 是个不错的权衡。但在一个执行数百个操作的长时间运行的 Agent 会话中,有害子集中 11% 的漏检率可不是四舍五入的误差,独立评论立刻指出了这一点。
提示注入的结果更有说服力,值得精确引用:在 720 次攻击尝试中,针对运行 Auto Mode 的 Claude Fable 5、Opus 5 或 Sonnet 5,无一成功。这是一个在真实威胁模型上取得的真实结果。但同样也是一个在固定攻击集上测得的结果,这与"提示注入已解决"是两回事。
这是公告报道跳过的部分。过去一年中,报道最广泛的两次针对编码 Agent 的攻击,都是通过 Agent 读取的内容(而非用户编写的代码)路由的。
其中一次,GitHub Issue 中的一段文字就足以将 Claude Code 和 Gemini CLI 导向其操作者从未要求执行的操作。另一次,依赖链中的一个受损 npm 包通过编辑器到达了开发者机器。在这两个案例中,Agent 与损害之间的最后一道防线是一个人看着提示并决定该操作是否有意义。
Anthropic 的数据显示那道最后防线在很大程度上是表演——97% 的批准率不是审查。这是一个公平的解读。但这意味着对 Auto Mode 的正确回应不是"信任它"或"关掉它",而是将您过去依赖的控制项从提示转移到拒绝规则中,在那里它不依赖于任何人是否阅读。
按机器而非按人来决定默认值。存放生产凭证的笔记本和运行一次性分支的临时容器不应该用相同的默认值。当环境本身廉价到可以销毁时,Auto Mode 要容易接受得多。
为那些您永远不会批准的事情写硬性拒绝规则。凭证文件和密钥存储库。任何推送到远程或包注册表的操作。向您允许列表之外的主机发起的网络调用。删除工作树之外的任何内容。这些是静态规则;写一次就好。
检查 Agent 能触及什么,而不只是它能做什么。提示注入筛查降低了恶意文本操控 Agent 的概率。限制环境范围降低了万一被操控后的损害程度。第二点由您控制且不会退化。
如果您是团队运营,则在中央锁定默认值。管理员可以通过托管设置设置不同的默认值或禁用 Auto Mode,这是对 Team 计划有意义机制。什么都不做也是一种选择,而在周四它是一个有了新含义的选择。
知道如何在会话中途切换。您可以随时在会话内更改权限模式。知道这个开关存在才能让默认值变得可以忍受——在 Agent 触碰您在乎的东西的那十五分钟里,您可以切换到更严格的模式。
Auto Mode 赌的是模型一致地应用策略胜过人类不一致地应用判断。Anthropic 自己的数据支持这个赌注,而 97% 批准率统计数据是整个公告中最有力的证据——不是因为它恭维了 Auto Mode,而是因为它告诉您,您以为拥有的那道控制实际上早已不存在。
您不应该做的是把"89% 被阻止"读作安全保证,因为同一句话里还包含"11% 没被阻止"。把 Auto Mode 当作它实际的样子来对待:一个比没人读的提示更好的默认设置,位于一个您仍需负责范围的环境之上。
Originally published on www.nihardaily.com. For more articles like this one, visit www.nihardaily.com.