前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9275
  • 自实现令牌桶限流:比等 429 更优
  • 长时 AI 任务用后台任务队列:状态机比框架重要
  • asyncio 并发调用 40 个 LLM:代码少但坑多
  • AI 项目中 API 密钥的泄密风险与防护层级
  • 电话Agent工程实践:SIP/WebRTC音频路径全解析
  • pgvector索引调优:HNSW与IVFFlat成本精确分析
  • 多租户应用按客户计费:成本与可计费用量必须分开
  • PDF 解析难点深度剖析:字符间距阈值是万恶之源
  • Hugging Face开源OlmoEarth文本嵌入
  • 阿里开源 Qwen3.8:2.4T MoE、激活 95B、256K 上下文
  • MiniMax H3:单个 Transformer 替代视频生成完整流水线
  • DeepSeek V4 Pro 正式版发布:多项测试接近 Fable 5 水平
  • AI编程助手Lovable完成新一轮4亿美元融资,估值达133亿美元
  • MiniMax Music 3.0:开放权重生产级音乐生成模型
  • Microsoft 发布 MindTopo:VLMs 空间推理能力新基准
  • Grok 4.6 发布:剑指 GPT-5.6 Sol,主打长时间 Agent 任务
  • Grok 4.6 中文详解:训练数据、Agent 能力边界与定价
  • 市场份额报告:Google Gemini 份额从 12% 跌至 1.9%
  • 用Embeddings+Reranking+LLM构建可靠的内容分类流水线
  • 推理冷启动从10分钟降至秒级:容器镜像瘦身实战
  • Anthropic研究揭示:Claude Code旧版权限提示97%被机械通过
  • DeepSeek-V4-Pro-0813 悄然上线,支持思考与非思考模式
  • AI 生图 Prompt 审核实战:Node.js 调用 Chat JSON Schema 方案
  • 企业AI分析的隐藏陷阱:语义漂移问题深度剖析
  • AI 正在消除软件工程中层:代码看不懂、没人负责的团队困境
  • Qwen3.8-2.4T-A95B 模型发布
  • TraceMotive:本地优先的AI代理执行追踪调试工具
  • AI编程工具正在离开IDE:终端原生Agent工作流崛起
  • 个人开发者用AI编程的项目架构经验
  • FastAPI五个安全漏洞发现与修复全过程
  • 长文档AI审核的审计设计:Map-Reduce优于检索增强
  • AI Agent辅助发现SharePoint RCE漏洞链(CVSS 9.1)
  • 我用Claude Code将API的P99延迟降低一半
  • AI Agent读了你的secrets并删了生产数据库——PocketOS事故详解
  • 用聊天模型做金融内容审核:结构化输出设计实践
  • Prompt注入攻击原理与防御实践指南
  • 大规模漏洞扫描活动泛滥,攻击者冒充ClaudeBot等AI爬虫
  • 谷歌DeepMind发布手语转文本模型SL2T
  • LFM2.5-VL-3B:边缘设备高性能视觉语言模型发布
  • 通义千问3.8-27B发布,刷新开源大模型参数效率
  • 多Agent协作陷阱:个体测试全过,团队输出仍错误
  • Agent Plugins:Vercel/OpenAI/Microsoft 等联合推出 Agent 技能打包新标准
  • 企业实战:50+ AI Agent在UK主权云上的部署架构
  • ZeroGPU Router:让 AI Agent 用小模型处理例行任务
  • Solv Labs在AWS Bedrock上构建可审计的Agent支付系统
  • CodeBurn:让AI编程投入产出可见化
  • AWS SageMaker HyperPod分层KV缓存:LLM推理新范式
  • 2026年AI Agent安全开发指南
  • 从专有LLM API窃取推理痕迹研究
  • AI代码审查门控:让AI生成的补丁先自证再合入主分支
  • AI 正在消灭软件工程中层阶级
  • 已加载 51 / 9275
9.0
重磅
AI SCORE
编程提效2026-08-12 23:42

Anthropic研究揭示:Claude Code旧版权限提示97%被机械通过

dev.to · AI#Claude Code#AI安全#Agent
Editor brief · 编辑速览

Anthropic 用 1053 人测试证实旧权限提示形同虚设(人类仅拦截 13.6% 有害操作,97% 机械放行),8 月 14 日起 Pro/Max/Team 计划切换至分类器判断模式,仅在不可逆操作时中断。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Anthropic 在正式发布这个结论之前,针对 1,053 名测试者进行了一项研究——大多数工具从来不会对自己权限模型做这种诚实的自我审视:Approval Prompt 并没有起到预期的作用,而数据证明了这一点。

在这项研究中,自动模式(Auto mode,这个分类器负责判断哪些工具调用需要人工介入)捕获了 89% 的有害操作。而人类在旧的逐条 approval prompt 下的实际拦截率只有 13.6%。更触目惊心的是:这 97% 的弹窗无论操作是安全还是危险,都被用户条件反射地点掉了。

从 8 月 14 日开始,Pro、Max 和 Team 计划的新 Claude Code 会话将从此前的"每次工具调用前都询问"切换为"经过分类器路由,仅在不可逆、破坏性或面向外部的操作时中断"。Enterprise、API 和云合作伙伴部署(Bedrock、Vertex、Foundry)目前保持自愿开启,预计本月内也会有默认切换。分类器的开销不会单独计费。

97% 这个数字才是真正值得关注的

一个权限弹窗要真正成为安全机制,前提是阅读它的人确实在逐条评估。当 97% 都被机械通过时,这个前提根本不存在。人们在点击 yes,靠的是反射——和你点掉服务条款弹窗的方式一模一样。这个弹窗是场秀,它给了监督的表象,实际上什么都没监督,而唯一一次真正需要它的时候,反射依然像往常一样放行了。

这个问题的影响范围不局限于 Claude Code。任何工具如果把动作拦在逐条人工审批后面,并指望这种审批能成为有意义的检查,都是在押注 Claude Code 刚刚承认自己输掉的那场赌局。如果你的 CI 管道、部署工具或内部 Agent 框架有一个"点击确认"的步骤但已经没人真的在看了,那么这项研究就是对你自己的审批日志进行审计后可能看到的结果的一个预览。

"不可逆、破坏性、面向外部"在实际中可能意味着什么

Anthropic 没有公布分类器的精确边界,但这些类别可以对照已经在 CI 中运行 Agent 的团队所学会手动拦截的内容来理解:

不可逆:force-push、删除数据库表、删除分支、任何接近 git reset --hard 的操作。

破坏性:批量文件删除、覆盖未提交的工作、对范围超出临时目录的目录执行 rm -rf。

面向外部:推送代码、打开或关闭 PR、向 Slack 或邮件发送消息、发布到外部服务、除了运行会话的人之外对其他人可见的任何操作。

如果你已经以固定权限模式运行 Claude Code(auto-accept、plan mode 或自定义白名单),这些变化对你没有任何影响。这只影响那些依赖默认设置的会话——而那恰恰是大多数从未动过这个设置的用户所在的会话。

分类器不是你自己。它训练的是 1,053 名测试者在总体上认为有害的行为。它没有针对你的特定代码库、你的那个看起来可以随意删除但实际不可删除的 generated/ 文件夹、或者你仓库里某一次"常规"批量删除实际会造成灾难的脚本进行训练。

89% 的捕获率是研究人群的平均水平,不是对任何个体团队影响范围的保证。一个看起来很常规的破坏性操作(比如删除一个名为 tmp 或 build 的文件夹中的文件)可能不会触发分类器,即使在你的仓库里那个文件夹是承载运行时状态的。相反,某个对你的特定设置来说非常狭窄且特定的东西,分类器从未见过,却可能被标记,而实际上它完全没问题。

如果你在具有特殊故障模式的基础设施上运行 Agent,最安全的做法仍然是锁定一个明确的权限模式,而不是信任默认分类器已经学会了你的仓库的所有边界情况。分类器减少的是你需要考虑的平均事情数量。它并没有消除你对那些属于你自己的特定事情的需要思考。

真正发生变化的是什么

这件事被包装成了 UX 改进——减少打扰、更快的 flow。更准确的描述是:Anthropic 审视了自己的审批漏斗,发现它并没有捕获任何人类不会机械通过的东西,然后把真正的判断责任从人类反射转移到了一个训练好的分类器上。考虑到文中给出的数字,这是一个更好的赌注。这并不是说这个判断现在对所有可能的仓库都做得很好,而是说它是由一个有可衡量记录的东西做出的,而不是一个没有任何记录的东西。

已经在 CI 中半自动运行 Claude Code 或跨大量 Agent 部署的团队,早就在为这个缺口构建变通方案。这次的更新是 Anthropic 在追上那些团队早已开始使用这个工具的方式,而不是新增了一种能力。

在这之前你就已经在用固定权限模式运行 Claude Code 了吗?围绕旧的 approve-every-call 默认设置,你不得不构建了哪些变通方案?

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
推理冷启动从10分钟降至秒级:容器镜像瘦身实战
下一篇
DeepSeek-V4-Pro-0813 悄然上线,支持思考与非思考模式