提出在 AI 推理之前增加预处理过滤层,检测提示词注入、异常高熵内容和组织级合规限制,减少模型被操纵的风险。
AI 安全往往关注模型产出了什么。这很有必要,但忽视了一个更前置的问题:什么样的内容才应该被允许送达模型?
SAFi 的 Phase 0 正是针对这道边界的设计。它是流水线中的第一个治理阶段,在系统调用 AI 推理组件之前就已启动。其目的在于识别可疑的、被禁止的、或可能具有操纵性的请求,在生成过程开始之前就将它们拦截。
这一设计体现了一条实用的安全原则:在依赖下游控制之前,先降低暴露面。
Phase 0 使用若干互补的检测手段。它可以识别已知 prompt 注入模式、评估已配置的组织及业务单元限制,并对异常输入特征应用启发式规则,包括高熵内容和嵌入式指令。这些检测旨在捕获试图操纵系统行为、绕过治理规则、或引入与预期任务相冲突的指令的行为。
时机很关键。一旦模型已经处理过恶意指令,将可信上下文与不可信内容区分开来就会变得更加困难。通过在模型调用之前对请求进行筛查,SAFi 在外部输入边界和推理层之间建立了清晰的隔离。
Phase 0 也是确定性的。它不会让 LLM 来判断一条输入是否安全,而是应用明确的、可审查的控制措施,组织可以对其进行审查、配置、测试和改进。这使得安全决策更容易追溯,也有助于减少在边界处对概率判断的不必要依赖。
当 Phase 0 发现问题时,请求并不会凭空消失。SAFi 会将结果路由至一条明确的治理响应路径。这一区别对运维完整性至关重要。被阻止的请求应被记录为一条策略或安全决策,而非与系统故障混为一谈。用户和管理员应当能够理解一项请求被拒绝,是因为违反了已配置的边界,还是因为平台无法完成其检查流程。
Phase 0 并不是一个完美 prompt 注入防护的承诺。签名可能漏过新的攻击模式,启发式规则也可能产生误报或漏报。有效部署仍需要更新的威胁情报、细致的策略配置、对真实攻击场景的测试、监控以及人工审核。
它的价值更为精确和可辩护:Phase 0 建立了一个调用前安全检查点,使 AI 治理边界变得显式。
这正是更宏观的 SAFi 思路。安全不应被当作生成之后才施加的最终过滤器。它应当是输入到结果路径的一部分,在风险进入系统的各个节点上设置明确的控制。
组织可以在 Org Settings 中配置 Phase 0 控制项,或将其定义为 Policy 的一部分,从而使安全要求能够同时反映全组织标准和更具体的运维需求。
SAFi Phase 0:先审查,再推理,全程治理。