企业 RAG 系统从 SharePoint、Google Drive 等源拉取数据时权限复杂,文章详解如何在查询时实时校验用户权限,实现文档级细粒度访问控制。
企业组织正在采用检索增强生成(RAG)从公司知识源(如 Microsoft SharePoint、Google Drive 和 Atlassian Confluence)中挖掘洞察。然而,这些知识源包含受复杂权限结构管控的敏感信息。确保 AI 生成的答案遵守这些权限是企业 AI 面临的最大挑战之一。
本文探讨 Amazon Q 和 Amazon Bedrock Knowledge Bases 如何通过实时访问控制列表(ACL)强制执行,在查询时直接与权威来源验证权限来解决这一挑战。
考虑这样一个场景:SharePoint 站点所有者为其组织创建一个知识库。多个部门的团队成员使用 AI 助手从该知识库获取答案。关键要求是每个团队成员只能收到他们有权访问的文档的 AI 生成洞察。
这是一个普遍的企业挑战。组织希望在不影响现有安全态势的情况下普及对 AI 驱动洞察的访问。AI 响应中暴露的单一未授权文档可能泄露机密战略文件、未发布的财务数据或敏感的 HR 信息。
RAG 访问控制的一种常见方法采用复制-过滤方法来强制执行文档级权限。其典型工作方式如下:
数据源连接器(例如 SharePoint 连接器)作为定期同步任务的一部分拉取 ACL。
ACL 从数据源复制并存储为索引中的属性。
在查询时,AI 系统将登录用户映射到存储的 ACL 属性并相应地过滤结果。
虽然这种方法表面上看似合理,但存在三个根本性缺陷。
在该模型中,AI 系统承担唯一的强制执行责任,却并非权限的权威来源。这要求数据连接器在各种数据源间精确复制复杂且特定于源的 ACL 逻辑。每个数据源都有其独特的权限模型。在数十个连接器上映射继承层级、组成员资格、条件访问策略和拒绝规则是容易出错的工作。
通常,数据连接器支持按需或按客户定义的计划运行的拉取式同步。这些 AI 解决方案中的 ACL 是上次同步运行时的快照。有些解决方案使用基于事件的更新,但这并不能普遍适用。例如,Confluence 这样的数据源在组成员资格变更时不会发出事件。在同步间隔期间,被撤销访问权限的用户可能仍会收到他们不应再看到的文档的 AI 答案。
数据源定期更改或引入新的内容访问控制机制。SharePoint 中的新权限功能或 Google Drive 共享模型的变更可能导致 ACL 映射逻辑出现漏洞。在连接器更新之前,这可能暴露内容。
为解决这些挑战,我们在 Amazon Q 和 Amazon Bedrock Knowledge Bases 现有的检索前 ACL 过滤基础上实施了实时 ACL 检查作为额外的安全层。这确保系统通过在查询时直接与权威来源检查权限来强制执行最新的访问控制。这避免了对可能过时或映射错误的 ACL 数据的依赖。
下图说明了我们同时提供语义搜索性能和实时安全能力的混合方法。
图 1:Amazon Q 和 Amazon Bedrock Knowledge Bases 实时 ACL 强制执行架构,结合了检索前过滤(第 1 阶段)和针对权威来源的实时验证(第 2 阶段)
当用户向使用 Google Drive 知识库的 Amazon Q agent 提交查询时,系统分两个阶段强制执行访问控制:
Amazon Q 对向量索引执行语义搜索以找到最相关的文档段落。系统应用已存储在索引中的访问控制列表。这产生一组初步的候选文档。这一阶段是必要的,因为对索引中的每个文档进行实时 API 调用在规模上成本过高。
Amazon Q 通过调用 Google Drive API 实时验证候选文档。它使用管理员提供的服务帐号凭据通过模拟生成用户特定的访问令牌。Google Drive 维护与每个文档关联的访问控制列表的真实来源。用户无权访问的文档从检索结果集中排除。只有经过验证和授权的文档段落作为上下文传递给大语言模型(LLM)。模型利用这些知识来生成响应。
这种两阶段方法在性能与安全性之间取得平衡。它使用缓存的 ACL 以提高效率,同时通过实时检查确保正确性。除了 ACL 强制执行,Amazon Bedrock 还提供负责任的 AI 控制。这些包括用于内容过滤的 Amazon Bedrock Guardrails、减少幻觉的 grounding checks,以及可配置的安全策略,帮助组织负责任地部署生成式 AI 应用程序。
该方法提供三个关键优势:
权限始终保持最新 – 使用 RAG 产品时,同步周期之间不再有安全漏洞。如果员工的访问权限被撤销,该变更会在短时间内(而非数小时或数天)反映在 AI 响应中。
扩展的信心 – 组织可以扩展其知识库覆盖范围,因为实时 ACL 检查针对每个查询(无论数据源如何)都与权威来源验证权限。
降低运营负担 – 您无需担心同步频率。
"当我们开始为组织评估 AI 解决方案时,安全和合规团队明确表示他们的首要任务是确保同事只能查看他们有权访问的信息。这是一项基本要求,但许多平台难以真正解决这一问题。Amazon Q 的实时访问控制方法明确回答了这个问题,并在整个评估过程中展现出卓越的严谨性。它让我们的内部审查委员会充满信心地继续推进,为我们未来思考 AI 治理奠定了坚实基础。"
— Jamahl Wiggins, Sr. Specialist – M365 Innovation, Mondelēz International
Mondelēz International 已为跨越四个地区的 35,000 多名员工部署了 Amazon Q。
本文讨论了 Amazon Q 和 Amazon Bedrock Knowledge Bases 如何实现实时 ACL 强制执行来解决企业的关键安全挑战。双层 ACL 架构在查询时直接与权威来源验证权限。这确保 AI 生成的答案仅包含用户有权访问的内容。
要开始使用,请访问 Amazon Q 和 Amazon Bedrock Knowledge Bases。