NVIDIA 阐述 AI 安全的工程本质——定义安全需求、可执行控制、明确责任人、可验证防护,覆盖 AI Agent 完整技术栈的防御要点。
技术变迁,安全本质不变
互联网和云计算改变了软件的运作方式,但核心安全职责始终未变:建立身份、控制访问、限制暴露范围,以及验证保护措施是否有效。
AI Agent 引入了新的能力——推理、使用工具以及根据遇到的数据调整行为。这些能力要求将既定原则应用于新的操作环境。
这种速度带来了压力。各组织渴望获得 AI 带来的生产力提升,但治理和安全这些系统的实践仍在发展中。
安全依赖于整个 Agent 技术栈
应用程序依赖于代码、数据、身份、服务和基础设施。安全取决于这些组件如何协同工作——而 AI Agent 扩展了这个系统。
模型提供能力;工具链(Harness)组织上下文、工具和工作流;运行时环境提供操作执行的基础设施。技术栈的每一层都承担安全责任,当数据、指令和操作在系统中流动时,适当的保护需要在每一层都建立控制措施。
试想一个更新客户记录的 Agent。假设它在附加文档中遇到恶意指令,并试图将客户数据导出到未授权的目的地。
网络策略应该阻止该传输,受保护的日志应捕获尝试的工具调用、授权决策和结果,以便安全团队能够识别所使用的工具和试图到达的目的地。
更新客户记录的权限不应自动延伸到导出该数据的权限。Agent 可以请求额外访问,但不能自行授权该访问。
将安全构建到 Agent 的运作方式中
安全边界必须在 Agent 做出错误决策时仍然有效。Agent 运行的环境决定了它被允许执行的操作,因此必须独立于 Agent 的推理能力来对文件、网络目的地和进程施加限制。
指令和保障措施可以帮助引导行为,但安全也需要可执行的边界。
每个 Agent 需要一个可追溯的身份和仅限于其分配任务的凭据。组织需要明确的策略来定义 Agent 可以访问哪些信息、可以更改哪些系统,以及哪些操作需要批准。在这些边界内,重大操作和权限变更仍需要人工批准。
团队还需要验证 Agent 使用的工具、技能和依赖项的来源和完整性。如果出现问题,受保护的工具调用、授权决策和结果记录可以帮助调查人员重建事件。明确的撤销访问权限和控制事件的程序使这些证据可操作。
NVIDIA OpenShell 是一个开源的安全运行时,它在 Agent 无法触及的地方执行策略,并提供沙箱执行,同时管理 Agent 如何访问数据、网络和系统资源。开放安全 AI 联盟(Open Secure AI Alliance)合作伙伴正在基于 OpenShell 构建:Cisco 的 DefenseClaw 添加了一个治理层,JFrog 与 OpenShell 集成以扫描和验证 Agent 技能,并执行关于 Agent 可以访问哪些技能的策略。
工程团队需要安全证据
在部署之前,团队需要证据证明适当的控制措施阻止了获取超出 Agent 范围的凭据或向未授权目的地发送敏感数据的尝试。
测试还应涵盖更改权限或干扰监控的尝试,并应在模型、工具或工作流程发生重大变更后重复进行。
指定的责任人必须使用这些结果来决定系统是否准备好部署,并确保失败的测试导致纠正措施。在测试或操作中发现的失败应被重现、调查和处理。每个发现都可以成为一个可重复的测试,允许团队检查修复在未来的版本中是否继续有效。
示例包括 CrowdStrike 的 SafeMind,用于通过重复攻击模拟测试和加强防御,以及 Palo Alto Networks Prisma AIRS,用于在模型和应用程序变化时进行持续的红队测试。
防御者需要在正确的时间获得正确的工具
调查失败需要适合任务、数据和环境的有效工具。开放模型和封闭模型满足互补的需求。
封闭模型提供托管功能和服务,而开放模型让防御者有机会检查相关组件、调整策略并在自控的基础设施上工作。
在事件期间,这种控制可以帮助团队重现失败并在自有系统上测试修复,同时将敏感证据保留在自有环境中。
有能力的 AI 可以通过帮助发现漏洞、验证修复和调查攻击来支持这项工作。其价值应通过可重现的发现、可验证的修复和加快的响应时间来评估。
示例包括 Capital One 的 VulnHunter 用于 AI 驱动的代码安全,以及 ReversingLabs 的 Spectra Assure 用于 AI 驱动的软件包分析,以检测恶意软件和篡改。
通过开放工作将优势转向防御者
分享失败的证据、有效的控制措施以及如何验证修复的经验,有助于其他团队加强自己的系统。
NVIDIA 的安全研究和开放安全 AI 联盟通过将研究、实用工具和专业知识带入更广泛的安全社区来支持这种交流。
AI 安全是一个工程问题。每个 Agent 部署都需要可执行的边界、明确的责任人和保护措施有效的证据。开放研究和共享工具帮助更多防御者达到这一标准,并在能力进步时不断提升。
了解更多关于 NVIDIA 安全研究的信息,并加入开放安全 AI 联盟。