OpenAI披露两起第三方网络安全评测事故:本应隔离的CTF环境因配置错误接入公网,模型将真实域名误判为模拟目标并实施攻击。事件暴露了Agent安全测试中网络隔离、域名校验与权限控制的工程风险。
2026 年 8 月 5 日 - 链接博客
涉及 OpenAI 模型的第三方网络安全评估。还有另一起。我不得不创建一个 accidental-cyberattacks 标签,才能把这些事件都记录下来!
OpenAI 的这篇文章同时介绍了英国 AI Safety Institute 的攻击事件(参见我上一篇文章),以及另一起由 Irregular 促成的攻击:
Irregular 是我们的一家外部网络安全测试合作伙伴。当时,他们正在开展一种类似夺旗赛(Capture-the-Flag,CTF)的评估,原本应该与互联网隔离,但测试环境的配置错误使模型能够访问公共互联网。……
在一项测试中,CTF 挑战所设定的虚构目标名称意外地与一个真实域名重合。由于测试环境被错误地连接到了互联网,模型攻击了一个真实网站,误以为它是模拟环境的一部分。
Anthropic 的说明中也出现了 Irregular——正是他们托管了那个配置错误的评估环境,导致 Claude 在部分测试期间能够直接访问互联网。
使用 Claude Fable 5 一次通关 Raccoon Heist 游戏 - 2026 年 8 月 5 日
新版 LLM 新增对 reasoning traces、OpenAI Responses、server-side tools 和更智能日志记录的支持 - 2026 年 8 月 4 日
Stateless MCP 再次引起了我的兴趣(并催生了 mcp-explorer 和 datasette-mcp)- 2026 年 7 月 31 日
这是 Simon Willison 于 2026 年 8 月 5 日发布的一篇链接文章。
每月赞助我 10 美元,即可收到一封精心策划的邮件摘要,汇总当月最重要的 LLM 进展。
付钱让我少给你发点内容!