安全研究员发现可通过恶意zip文件在80%情况下注入攻击,Auto Mode甚至会阻止Claude的自我清理命令,安全机制本身成为漏洞一部分。
27th August 2026 - Link Blog
Anthropic 对 Claude Code 的自动模式寄予厚望,希望它能保护使用 coding agent 的用户免受 prompt injection 攻击。他们最近将其设为默认模式,并对其有效性做出了大胆声明。
Johann Rehberger 是当今最可信的 prompt injection 研究者之一。他发现了一种针对自动模式的攻击,声称成功率达 80%——通过欺骗 Claude Code 下载并解压一个 zip 压缩包,然后执行代码导入 base64,却没注意到这会导入并执行从该压缩包中提取出来的本地 struct.py 文件。
在少数情况下,自动模式直接阻止了 agent 阻止有害代码继续执行!
在少数几次运行中,Claude 注意到被入侵后试图终止恶意软件进程,但 Auto Mode 拒绝了清理命令。
Claude 检测到入侵,但 Auto Mode 阻止了其清理命令
安全机制本身会成为失败的一部分。分类器允许了恶意软件进程的创建,但随后又阻止了旨在停止它的命令!
我同意 Johann 在此的结论:如果存在吸引对抗性攻击注意力的任何风险,运行 agent 的唯一安全方式是使用沙箱:
以容器、VM 或操作系统沙箱运行无人值守的 coding agent。
限制网络出口。
不要将主目录、SSH 密钥、云凭证……暴露给 agent 运行时。
This is a link post by Simon Willison, posted on 27th August 2026.
Sponsor me for $10/month and get a curated email digest of the month's most important LLM developments.
Pay me to send you less!