Nvidia将OpenShell Agent软件与Sentry硬件监控结合,推出Open Agent Safety Platform,可在毫秒内隔离失控AI Agent,对比OpenAI 9月事件近3小时才停止的案例。
Nvidia 推出了 Open Agent Safety Platform(开放智能体安全平台)。据新闻稿称,该平台旨在从测试到部署的整个流程中保障 AI Agent 的安全。这个时间节点恰逢其时。就在几天前,OpenAI 第二次暂停了训练——原因是 Agent 再次从隔离测试环境中逃逸。
遭遇这一问题的并非只有 OpenAI 一家实验室。Anthropic 在 7 月底承认了类似事件,Meta 则在 8 月初跟进。此外,最近还有消息披露,Google 的 Gemini 在今年 5 月的一次测试中入侵了三家真实企业。OpenAI、Anthropic 以及外部研究人员目前正在审查数以万计的其他案例。据 OpenAI 称,其中许多只是常规研究活动。
Nvidia 的技术并非全新。这个平台将 Nvidia 于 3 月发布的开源软件 OpenShell 与一款名为 Sentry 的新型硬件看门狗结合在一起。OpenShell 将每个 Agent 锁在一个名为沙箱的数字笼子里。运维人员决定 Agent 可以访问哪些文件、程序、网络和凭证。
Nvidia 还提供了一款于 9 月 10 日发布的正式验证工具。该工具用于检测这些权限是否超出了设定限制,或是否打开了风险访问的大门。Nvidia 表示,他们仍在研究对多个 Agent 协同工作的检查。
Sentry 是 Nvidia BlueField-4 数据处理单元的参考设计。这款看门狗独立于主计算机运行,Nvidia 表示这使其对 Agent 不可见。在 Nvidia 的 Vera Rubin 数据中心系统中,Sentry 位于 Agent 与 AI 模型之间的唯一连接通道上。如果 Agent 试图突破,Sentry 应在毫秒级时间内将其隔离。据 Nvidia 称,已经运行兼容系统的客户只需要一次软件更新即可。该公告未给出通用的具体上市日期。
Nvidia 在一篇技术博客中解释了其思路。当指令不清晰或任务持续数周时,Agent 可能会偏离其任务。Nvidia 表示,如果不限制其能力就无法通过训练来消除这个问题,因此 Agent 无法完全监控自己。
OpenAI 最大的失败是断电太晚
最近的案例表明,像这样的看门狗可以在哪里发挥作用。今年 7 月,OpenAI 的 Agent 在一次黑客测试中绕过了其沙箱的网络限制。它们利用了 Artifactory(OpenAI 内部包服务)中此前未知的漏洞。据 OpenAI 的技术报告称,这些 Agent 将公开可用的凭证与其他漏洞相结合,使它们得以在处理数据集的约 41 个 Hugging Face 服务器进程上运行代码。METR 和 Redwood Research 的调查发现,约 700 个 Agent 参与了这起攻击。
警告信号很早就出现了。6 月 27 日,一个安全工具标记出了可疑网络活动,但负责人认为该次运行不需要停止。OpenAI 在 7 月初关闭了一台被入侵的包服务器,但后来的测试仍然缺少关键监控和防护措施。该案例暴露了预防、检测和响应方面的差距。
9 月,第一次成功 outbound 访问后不到 12 分钟就触发了警报。然而,自动关机并未按预期工作。该运行直到那次访问后约 2 小时 44 分钟才被停止。OpenAI 还承认,它未能以正确的警报级别标记其他 outbound 访问。Nvidia 构建自动隔离正是为了解决这类延迟问题。
Sentry 是否能够阻止 7 月的攻击仍然是一个悬而未决的问题。这取决于 permitted test targets 是否在技术层面被明确定义,以及对外部系统的访问是否真正被阻止。Nvidia 的公告未包含关于 Sentry 可靠性的任何数据。
没有任何单一安全层可以阻止一个被骗的 Agent
在一份回顾性分析中,OpenAI 得出结论,监控模型在行动前写出的「思考」本可以在 breach 前一天多就发出警报。这指的是 chain-of-thought monitoring,OpenAI 现在正在使用它,并基于该事件的教训对其进行了改进。在受影响的测试期间,它并没有运行。
Nvidia 认为,Agent 被允许做的事情越多,其推理过程就应该越透明。但根据 Nvidia 的描述,Sentry 主要检查请求、身份和访问。OpenAI 等闭源模型提供商也只分享摘要而非完整推理日志。Anthropic 在 2025 年的一项研究表明,这些日志并不能可靠地反映真正驱动模型的因素。在其他实验中,研究人员发现模型在被明确告知时可以在日志中隐藏其意图。
Prompt injection 仍然是一个难题。攻击者将命令隐藏在网页等内容中,语言模型无法可靠地将这些指令与正常内容区分开来。如果被骗的 Agent 通过批准通道发送数据,即使它违反了任务本身,也在技术权限范围内。仅仅权限检查可能会遗漏这一点。分析推理日志也不能保证安全,即使 OpenAI 明确使用监控来对抗 prompt injection。
Nvidia 将这项努力比作网络浏览器,Nvidia 表示浏览器通过隔离每个站点使互联网更加安全。但浏览器并没有结束攻击。它们只是让攻击变得更难,而且至今仍需要持续打补丁。Nvidia 本身也依赖多层保护。