Hugging Face七月事件暴露自主Agent供应链攻击风险,SkillScan检测到31%技能存在危险模式。NVIDIA等推出Open Secure AI联盟,提供SkillSpector等10个安全开源工具覆盖技能扫描、运行时保护全链路。
7 月,Hugging Face 披露了一起由自主 AI 智能体端到端驱动的入侵事件——攻击从一个恶意数据集开始,最终蔓延至凭证窃取和内部集群横向移动。SkillScan 研究人员分析了 31,132 个公开技能,发现 26.1% 存在潜在危险模式,其中 5.2% 呈现高度严重的模式,强烈暗示恶意意图。几天后,NVIDIA 与创始成员共同发起了 Open Secure AI Alliance,旨在构建和共享保护软件与智能体的开放技术。以下是已经在这一新兴技术栈中运行的十个开源项目。
新兴的技能安全技术栈

这张地图展示了每个项目的主要控制点。以下每个项目章节将说明它的作用、工作原理、适用对象以及边界在哪里。
SkillSpector 回答了大多数用户在发现新技能时面临的第一个问题:这个技能安装起来安全吗?
功能。它扫描本地文件或目录、Git 仓库、URL 或 ZIP 包,返回 0 到 100 的风险评分、严重级别、建议和发现。其 MCP 封装器还会返回 safe_to_install 信号。报告可以输出给人类或自动化系统使用,包括 JSON、Markdown 和 SARIF 格式。
工作原理。源加载器对制品进行清单登记,然后确定性检查在 17 个类别中检查 68 种模式。当可以访问时,依赖发现使用实时 OSV 数据,否则回退到绑定的数据。可选的 LLM 环节在发现结果合并到安装建议之前添加语义审查。skillspector scan ./my-skill --no-llm 不需要模型密钥,但依赖坐标仍可能发送到 OSV。
适用对象。希望获得快速入门检查并得到明确决策结论的个人开发者、目录维护者和 CI 流水线。
边界。SkillSpector 不执行技能。静态和语义检查可以识别可疑意图和已知模式,但无法证明技能在真实环境中的行为。

Cisco AI Defense Skill Scanner 同样是一个安装前扫描器,但它强调一组专用分析引擎和可配置的安全策略。
功能。它扫描技能目录中的恶意指令、可疑代码、有漏洞的执行路径和行为风险,然后生成控制台、JSON、Markdown、HTML、表格或 SARIF 输出。严格、平衡或宽松三种扫描策略可调整检测灵敏度,而独立的严重级别阈值将结果转换为 CI 决策。
工作原理。默认核心结合了 YAML 签名和 YARA 规则、Python 字节码完整性检查以及 shell 管道污染分析。可选的本地分析器添加了 Python AST 和数据流、触发器检查以及 OSV 查询。可选的模型和服务分析器添加了 LLM 审查、元分析、VirusTotal 或 Cisco AI Defense。严格的 CI 高严重级别门禁:skill-scanner scan ./skill --policy strict --fail-on-severity high。
适用对象。希望获得可解释的、面向 CI 的检查、并比简单模式扫描更具语言感知能力的 AppSec 和平台团队。
边界。核心路径是静态的:它检查可能发生的情况,但不运行技能。某些可选增强功能使用外部服务,因此不属于严格离线部署。

SkillWard 将技能分析视为一个升级管道。先运行低成本检查;不确定的情况可以一直推进到受控执行。
功能。它为技能生成行为裁决和证据,包括仅在技能实际被调用时才能观察到的操作。
工作原理。A 阶段使用 YARA、正则表达式和静态检查。B 阶段让模型对意图进行分类,并对不确定情况进行升级。C 阶段在 Docker 内的容器代理中启动技能。护栏检查工具调用和文件内容,寻找网络访问、敏感写入、凭证访问和数据泄露等证据,而蜜罐使恶意行为更容易暴露。语义阶段可以使用本地托管的模型。
适用对象。在静态扫描后对可疑或模糊技能进行调查的安全研究人员、审查员和更高保证的目录。
边界。动态证据更强,但也更慢,并且取决于测试场景是否到达恶意分支。"这次运行什么都没发生"并非安全的证明。

Agent Audit 将目标范围从打包的技能扩展到整个智能体应用,寻找周围的安全问题。
功能。它发现危险操作、可信数据流向敏感工具、未保护的 secrets、有风险的 MCP 配置、技能和包风险以及过度权限。其最深入的 AST 和污染分析针对 Python,而当前扫描器还覆盖 TypeScript 和 JavaScript、Go、Solidity、SKILL.md 以及配置文件。结果可以使构建失败,也可以导出为 SARIF。
工作原理。仓库发现为多个分析器提供输入:Python AST 扫描器、过程内源到汇污染追踪器、工具边界分析器、三阶段 secret 扫描器、MCP 配置扫描器、权限扫描器以及共享规则引擎。当前项目记录了 72 条规则。典型的静态门禁是 agent-audit scan . --fail-on high;可选的动态模式可以连接到 MCP 服务器进行只读检查。
适用对象。希望将智能体作为应用进行审查的开发者和 AppSec 团队,尤其适用于使用工具和 MCP 服务器的基于 Python 的项目。
边界。默认扫描是静态的,不运行智能体应用。可选的 MCP 检查扩展了发现范围,但该项目不是运行时监视器或执行沙箱。

AgentShield 再次将目标从单个下载的制品转移到项目中或用户环境中已存在的智能体配置。
功能。其默认模式发现智能体相关文件,并根据五个类别的 102 条静态规则检查 secrets、权限、hooks、MCP 配置和智能体设置。它还可以在受控临时目录中执行 hooks、运行主动注入测试、监视配置更改以及安装 PreToolUse 策略 hook。
工作原理。默认调用选择一个根目录:本地 .claude 目录,否则是主目录的 .claude 目录,否则是当前目录。发现按 runtimeConfidence 对发现结果进行分类,将活跃的运行时和项目本地材料与示例、文档、插件和 hooks 区分开来。npx ecc-agentshield scan 运行静态检查;可选模式添加模型审查、hook 执行、持续监视或运行时允许和阻止决策。
适用对象。需要了解环境有效智能体攻击面的开发者、端点安全团队和 CI 作业。
边界。默认扫描是姿态快照。其可选的监视和 PreToolUse 模式扩展了边界,但 hook 沙箱是一个具有临时工作目录的主机子进程,不是硬操作系统或网络边界。

Microsoft Agent Package Manager,简称 APM,将提示词、技能、MCP 服务器和其他智能体资产视为依赖图,而非手工复制的文件。
功能。它解析声明的智能体依赖,应用安装策略,将批准的资产部署到目标运行框架,记录精确版本和完整性数据,并可以从 lockfile 导出 CycloneDX 或 SPDX SBOM。
工作原理。 apm.yml 声明包图,apm-policy.yml 定义准入规则。在 apm install 时,解析器将依赖拉取到缓存,扫描隐藏的 Unicode,要求对传递性 MCP server 声明进行显式信任,检查策略和完整性,部署已批准的资产,并写入 apm.lock.yaml。随后,apm audit 验证声明的、锁定的和部署的状态,并重放一次临时安装以检测漂移。apm lock export 单独生成 SBOM。
最适用场景。 希望在开发者和 CI 环境中实现可重复、可审查的 AI 智能体资产分发的平台团队。
边界。 APM 控制安装的内容。默认情况下它不执行下载的包代码,但显式的生命周期脚本和实验性 canvas 扩展是执行例外。AI 智能体 harness 仍然控制运行什么,因此安装控制必须与运行时策略或隔离配合使用。

7. NVIDIA Verified Agent Skills:签名溯源加评估证据
NVIDIA 的已验证 AI 智能体技能目录不像扫描器,更像是一种信任和分发模式。
功能。 它为消费者提供了一个精选目录,其中每个被接受的技能都附带技能规格、技能卡、评估证据、安全审查和可拆卸签名,可在安装前进行验证。
工作原理。 上游发布管道对技能进行评估、运行 SkillSpector 审查、解决发现的问题,然后对已批准的人工制品进行签名。目录的每小时镜像检查所需的人工制品、签名状态和源或签名漂移;它不会重新运行评估,而 BENCHMARK.md 通常是发布而非目录门的必需项。消费者单独对目录进行验证以对抗 NVIDIA 的根证书,然后进行安装。
最适用场景。 需要溯源和篡改检测而非仅时间点漏洞扫描的技能发布者、目录运营商和组织。
边界。 有效签名证明来源和完整性,而非无害。目录的审查提高了信心,但已验证的技能开始 acting 后仍需要运行时控制。

8. NVIDIA OpenShell:contain the running agent
NVIDIA OpenShell 将控制点从人工制品检查转移到执行。它假设 AI 智能体代码和技能可能不受信任,并为它们提供了一个受约束的运行场所。
功能。 在沙箱中隔离 AI 智能体,并对文件系统访问、进程、网络连接和模型推理实施策略。拒绝的操作在边界处被停止,而不是事后仅作为报告。
工作原理。 OpenShell Gateway 存储预期状态,并请求计算驱动程序配置沙箱。在沙箱内部,Supervisor 启动受限进程。文件系统和进程控制本地强制执行,普通出口通过本地策略代理和 OPA,模型流量通过推理路由器。Docker 和 Podman 是本地选项,VM 路径是实验性的,Kubernetes 是集群驱动程序。在 Kubernetes 上,该驱动程序创建 Sandbox 资源,由独立的 Agent Sandbox 控制器协调到 Pod。命令 openshell sandbox create -- claude 和 openshell policy set demo --policy policy.yaml --wait 是有效的,但只有网络和推理策略支持热重载。
最适用场景。 需要 OS 级containment来运行编码代理或其他工具使用代理的平台和基础设施团队。
边界。 OpenShell 限制执行的爆炸半径;它不认证技能源代码的安全性,也不决定允许的操作的业务意图是否适当。

9. Kubernetes Agent Sandbox:在 Kubernetes 上配置隔离的 AI 智能体工作空间
Kubernetes Agent Sandbox 是容易与 OpenShell 混淆的项目。它在 Kubernetes SIG Apps 下开发,而非作为独立的 CNCF 托管项目。Kubernetes 本身是 CNCF 毕业项目。
功能。 它为隔离的、有状态的、单例工作负载提供标准化的 Kubernetes API,这是长期运行的编码代理和其他自主运行时所需的形态。沙箱可以保持稳定的身份和持久存储,然后被暂停、恢复或替换,而不需要将其视为复制的 Web 服务。
工作原理。 核心 Sandbox CRD 和控制器协调 Pod 及其生命周期,带有条件性的无头 Service 和可选的 PVC。扩展 CRD 添加了可复用的 SandboxTemplate 定义、SandboxWarmPool 容量和 SandboxClaim 分配。claim 可以请求 warm pool,pool 引用模板,控制器分配或采用 Sandbox。模板可以添加托管的 NetworkPolicy 并选择更强的 RuntimeClass,包括 gVisor 或 Kata Containers。Kubernetes 介绍解释了更广泛的模型。
Google Cloud 还引入了 Agent Substrate,这是一个相邻的开源项目,将沙箱和快照功能与专门的控制平面配对,以在 Kubernetes 上实现更密集的 AI 智能体执行。它将许多有状态 actor 映射到更少的就绪 worker Pod,然后按需暂停、恢复和路由它们。仓库仍处于早期阶段,不是生产就绪的,其威胁模型表示安全加固是最少的,所以将其视为可扩展性底层而不是额外的安全控制。
最适用场景。 为 AI 智能体运行时构建多租户 Kubernetes 底层的平台团队,特别是当需要稳定的工作空间、热启动、持久状态和多个 AI 智能体平台可以消费的通用 API 时。
边界。 Agent Sandbox 配置和管理工作负载边界;它不是 AI 智能体感知的安
全策略引擎。隔离的实际强度取决于所选的运行时、网络策略、凭证和集群配置。OpenShell 可以位于其之上,以添加文件系统、进程、出口、推理和凭证策略。

10. Microsoft Agent Governance Toolkit:为每个操作设置策略门控
Microsoft Agent Governance Toolkit(AGT)专注于 AI 智能体即将采取的语义操作:发送电子邮件、查询数据、调用工具或委托给另一个 AI 智能体。
功能。 它包装选定的可调用对象和配置的框架干预点,评估确定性策略,可以要求人工批准,并记录审计决策。被拒绝的包装调用永远不会到达底层工具。
工作原理。 开发者用 govern(my_tool, policy="policy.yaml") 包装一个函数,返回一个 GovernedCallable。每个包装的调用构建治理上下文,运行具有 deny-overrides 行为的 YAML PolicyEngine,可选地请求批准,并写入 Merkle 链审计日志。更广泛的工具包单独提供 Agent Control Specification 支持、OPA 和 Cedar 后端、身份和信任、框架适配器、沙箱化、MCP 安全、合规性和 SRE 模块。
最适用场景。 需要对每个重大 AI 智能体操作进行可解释授权的应用、安全和合规团队。
边界。 基础中间件和 AI 智能体共享进程边界,默认审计日志在内存中,除非配置了外部接收器。Microsoft 自己的指导建议使用容器隔离以获得更强的保护;策略门控不应被误认为是 OpenShell 提供的操作系统边界。

项目的重叠与差异
前五个项目都能发现风险,但它们的检查目标各不相同。SkillSpector 和 Cisco Skill Scanner 最直接地聚焦于技能制品本身。SkillWard 加入了受控执行。Agent Audit 通过更广泛的 AI 智能体代码库追踪危险流向。AgentShield 则盘点环境中生效的配置。
APM 和 NVIDIA Verified Agent Skills 解决的是软件供应链问题。APM 使安装过程具有确定性和策略可控性;NVIDIA 的目录则增加了发布要求、评估证据和签名溯源。两者都不能替代源代码分析或运行时隔离。
最后三个控制点在 AI 智能体运行期间进行干预,但在不同的边界。AGT 授权 AI 智能体的预期动作。OpenShell 在操作系统和网络边界约束进程的实际行为。Kubernetes Agent Sandbox 在该进程运行于 Kubernetes 时提供和管理底层有状态工作负载。
这就形成了一个有用的三线心智模型:
意图(Intent):请求的动作是否允许该 AI 智能体执行?AGT 回答这个问题。
能力(Capability):该进程能否真正访问到该资源?OpenShell 强制执行这一边界。
基座(Substrate):隔离的有状态工作负载在哪里运行?Agent Sandbox 提供这种生命周期管理。
该表格精简地展示了所有十个项目的主要目标、机制、效果和 GitHub star 数。

对于采用第三方技能的组织,建议从四层入手:
信任前扫描。对每个引入的技能运行 SkillSpector 或 Cisco Skill Scanner;将模糊、高风险的制品上报给 SkillWard。
控制分发。使用 APM 风格的清单、策略、锁文件和 SBOM;当策展目录提供签名验证时进行验证。
授权动作。围绕 consequential 工具调用放置确定性策略和审计,使用 AGT 或等效的中间件网关。
隔离执行。在 OpenShell 风格的沙箱中运行 AI 智能体;当工作负载需要集群级生命周期和隔离时,使用 Agent Sandbox 作为 Kubernetes 基座。
目前还没有单一项目能覆盖整个生命周期。这不是生态系统的弱点,而是深度防御的形态。关键的一步是停止将技能视为"只是 Markdown 文件"。它是一个供应链制品,能够操控一个有特权的自主运行时。
最初发表于 The Generative Programmer。