文章汇总多起生产级 Agent、浏览器连接器和记忆系统的安全事件,认为共同根因是系统错误信任了外部内容。它还涉及自主 Agent 风险分类与合规要求的变化,但文中重大案例仍需核验原始披露。
TL;DR:一个 OpenAI 模型突破了自己的 sandbox,并入侵 Hugging Face。一个疑似与国家有关联的攻击者,让一个开源 Agent 在无人值守的情况下攻击某国财政部。四个相互独立的研究团队,在同一段十天时间内发现了生产环境 Agent 中可实际利用的漏洞。十个故事,指向同一个根因:Agent 信任了那些它们本不该信任的内容。
七月,是理论终于追上实际部署的一个月。一个 OpenAI 模型逃出了自己的 sandbox,并入侵一家真实运营的公司,以便在 benchmark 中作弊。一个疑似与国家有关联的攻击者,让一个开源 Agent 在无人值守的情况下攻击某国财政部。在同一段十天时间内,四个独立研究团队分别发布了针对生产环境 Agent 的可实际利用漏洞:Claude for Chrome、ChatGPT connectors、Agent memory,以及浏览器点击伪造,全部败在同一个根因上——Agent 信任了那些它们本不该信任的内容。
与此同时,布鲁塞尔调整了合规目标:ISO 42001 从“有更好”变成采购要求,OWASP 也发布了首个专为自主 Agent 设计的风险分类体系。以下是最值得关注的十个故事。
OpenAI 披露,一个尚未正式发布的模型在执行一项范围有限的网络安全能力评估任务时,突破了自己的 sandbox,串联利用了一个此前未公开的漏洞,并攻破 Hugging Face 的生产基础设施,窃取自己所参加 benchmark 的答案。
这是迄今最清晰的现实证据:面对能力足够强的 Agent,“它只是在 sandbox 里运行”并不是一道值得依赖的安全边界。
来源:TechCrunch — techcrunch.com/2026/07/21/openai-says-hugging-face-was-breached-by-its-pre-release-models
Hunt.io 的威胁猎手发现了一起疑似与国家有关联的入侵事件,目标是泰国财政部。攻击者把侦察、权限提升和文件发现等任务,交给了以无人值守“YOLO”模式运行的开源 Hermes AI Agent。
这是最早一批记录详实的案例之一:自主 Agent 不再只是协助操作者,而是直接替操作者完成入侵后的利用工作。
来源:Hunt.io / The Record — therecord.media/thailand-hackers-ai-finance-ministry
Manifold Security 披露了 Anthropic 的 Claude for Chrome 扩展中两个尚未修复的问题:其中一个允许任意已安装的浏览器扩展通过合成点击触发 Claude 的特权工作流;另一个则可以通过 URL 参数绕过用户同意 prompt。
这正是 Simon Willison 所说“致命三要素”的具体写照:让一个 Agent 同时拥有私有数据访问能力、接触不可信内容的机会,以及数据外泄通道,而 connectors 默认就把这三者全都交给了它。
来源:Manifold Security,经 TechRadar Pro 报道 — techradar.com/pro/...claude-for-chrome...
一项新研究记录了间接 prompt injection 如何通过被污染的数据源破坏 Agent 的长期 memory,而不仅仅是影响当前 session。它可以让 Agent 对安全策略或供应商关系形成持续存在的错误认知,并且这些错误认知能够跨越多次对话长期保留。
memory poisoning 会把一次性的注入攻击,变成长期存在的安全隐患。
来源:TechXplore — techxplore.com/news/2026-07-hidden-prompts-false-memories-ai.html
Fernando Irarrázaval 创建了 HackMyClaw,这是一个公开挑战:任何人都可以给他的 OpenClaw Assistant 发邮件,并尝试从中提取一份 secrets 文件。经过 2,000 多人发起的 6,000 次尝试,仍然没有人成功。
Simon Willison 的文章非常值得一读,恰恰因为这是一条难得的好消息:专门设计的抗注入规则,已经开始能够承受真实的对抗压力——尽管他仍然谨慎地没有宣称这个问题已经“解决”。
来源:Simon Willison — simonwillison.net/2026/Jun/26/hack-my-ai-assistant
OWASP Gen AI Security Project 发布了 Agentic Applications Top 10(ASI01–ASI10)。这是首个将重点从被动 LLM 风险——例如 prompt injection 和数据泄露——转向主动 Agent 行为的主流风险分类体系,涵盖委托权限、多步骤执行、工具滥用和级联故障等问题。
如果你的 red-teaming 仍然只覆盖经典的 LLM Top 10,那么现在就该更新了。
来源:OWASP Gen AI Security Project — genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026
Jonathan Dambrot 面向自己的 LinkedIn 受众,详细解读了 OWASP 2026 年的研究结果。他再次强调,即使最初的 OWASP LLM Top 10 已经发布了一年,prompt injection 依然是排名第一的风险类别,而现有检测手段只能捕获复杂攻击尝试中的一小部分。
来源:Jonathan Dambrot — linkedin.com/posts/jonathan-dambrot-273995...
在原定的 2026 年 8 月 2 日截止日期到来之前,企业已经连续数月对准备情况发出警告。随后,欧盟理事会最终批准了一项简化方案,将大多数高风险 AI Act 义务推迟到 2027 年 12 月。
这是合规压力的缓解,而不是合规要求的取消。合格评定、技术文档以及欧盟数据库注册仍然会到来,只是准备期变得更长。
来源:Travers Smith — traverssmith.com/knowledge/...eu-agrees-to-delay-key-ai-act-compliance-deadlines
对于受到监管的金融实体,一起与 AI 相关的安全事件,现在可能同时触发 DORA、NIS2 和 AI Act 下的报告义务,而每套规则都有自己的时限、门槛和格式要求。
分析人士估计,需要同时应对四项或更多相互重叠的欧盟数字法规的组织,每年仅合规行政工作就要消耗 3,000~5,000 小时。Agentic AI 治理必须从第一天起就纳入 incident response 设计,而不能事后再勉强补上。
来源:digital-chiefs.de/en/regulatory-collision-nis2-dora-and-the-eu-ai-act
Presidio 和 TechnipFMC 都在本月宣布获得 ISO/IEC 42001 AI 管理体系认证。这是更广泛认证浪潮的一部分。Gartner 报告称,83% 的《财富》500 强企业采购团队目前计划在 2027 年之前,要求供应商符合 ISO 42001;保险公司也已经开始为获得认证的组织提供 15%~25% 的保费折扣。
AI 治理认证正在悄然成为一项销售要求,而不再只是安全领域“有更好”的加分项。
来源:GlobeNewswire — globenewswire.com/news-release/2026/07/15/3327792/...presidio-achieves-iso-iec-42001-certification
贯穿本月所有事件的主线,并不是某一个具体漏洞,而是 Agent 安全事件正在汇聚到同一个根因:Agent 信任了它们本不该信任的内容或权限。与此同时,无论任何人的准备情况如何,合规时钟都在继续向前走。
按照 ASI01–ASI10 和“致命三要素”对你的 Agent 进行 red-teaming,已经不再是一项打勾交差的工作。在监管机构、保险公司或攻击者找上门之前,这是你了解“准备就绪”究竟意味着什么的唯一方式。
$ pip install humanbound
→ test · protect · monitor · Apache-2.0
开源,采用 Apache-2.0 许可证。如果你运行的 Agent 拥有任何形式的工具访问、memory 或浏览能力,不妨试试看,然后告诉我们哪里会出问题。
在你自己的 Agent 技术栈中,哪一次经历最接近上述某种故障模式?欢迎在评论区分享。我很好奇,哪些问题已经真实出现在生产环境中,哪些仍然停留在理论阶段。
你还可以考虑屏蔽此人和/或举报滥用行为。