Cloudflare推出Identity-aware AI Gateway开放测试版,通过用户行为基线检测内部风险,实时标记异常AI智能体行为。
当你查看 AI 账单时,很难判断是否存在异常。你首先需要一个基准,这样才能看到发生了什么变化——无论是失控的 Agent,还是使用量突然飙升 10 倍的员工。能够发现这些变化让你开始进行调查,但一直以来都很难看清它们。
了解谁在用 AI 做什么,是组织目前面临的主要挑战之一。斯坦福大学的一份报告发现,59% 的组织表示知识差距是他们实现负责任 AI 治理的最大障碍。
这是一个安全问题,也是一个财务问题。解决这些问题需要两件事:每个请求都有经验证的身份(这样异常峰值就能追溯到具体的人),以及该身份的正常行为画像。今天我们同时发布了两项功能。
集成 Cloudflare Access 的 Identity-aware AI Gateway 现已开放公测,User Insights 已面向每位 AI Gateway 客户正式发布,无需额外付费。两者协同将流经 AI Gateway 的流量转化为每个用户和 Agent 的行为基准,并识别出偏离基准的个体。
AI Gateway 是你所有 AI 使用的中央控制平面。无需每个应用和团队直接调用 OpenAI、Anthropic、Google 或 Workers AI 的模型,请求首先流经 AI Gateway,让你在一个地方观察、保护和治理所有 AI 使用。
它与你构建的应用以及开发者日常使用的编码工具都能配合工作。将 Claude Code、Codex 和 GitHub Copilot 等 Agent 工具路由通过 AI Gateway,它们就能和其他所有内容一样受到同等的可见性和控制。
通过 AI Gateway 与 Cloudflare Access 的集成,你可以在网关前放置自定义域名,并像保护其他应用一样用 Access 来保护它。这意味着你可以:
ai.example.com),URL 中不包含 account ID 或 gateway ID。每个经过身份验证的请求现在都携带来自 Access 的用户身份。AI Gateway 将经验证的 Access user ID 作为 cf.user_id 添加到请求元数据中,这样你就可以按实际发出请求的人来筛选日志、分析和支出。
结合支出限制,该身份成为一个预算工具。因为每个请求现在都携带真实用户,你可以设置按用户的支出限制:为每个用户提供独立的预算桶,然后在达到限额时阻止进一步请求或回退到更便宜的模型。不再有意外的账单,也不会有共享 API 密钥掩盖谁花了多少钱。
我们的早期采用者之一 Flexport 恰好遇到了这个问题。
Flexport 的安全工程师 Max Baumgarten 表示:"共享 API 密钥几乎不可能追踪谁在使用 AI 服务,也无法应用我们已有的员工访问规则。在 AI Gateway 前放置 Cloudflare Access 为每个请求提供经过身份验证的身份,让我们能够在网关层面使用现有的身份策略。我们的团队可以采用 AI 工具,而无需为每个客户端创建单独的身份验证系统。"
很快,你就能够利用用户的身份提供商组来设置支出限制或控制某个组可以访问哪些模型。例如,为你的机器学习团队提供前沿模型的访问权限,限制支持团队的支出,或为参与特定项目的每个人设置预算——所有这些都映射到你已在身份提供商中管理的组。
在 AI Gateway 中,你现在会看到一个名为 User Insights 的标签页。User Insights 读取通过网关的流量,将其转化为每个账户的行为画像。它学习每个账户的正常行为方式,识别偏离该模式的账户,并提供背景信息来帮助你区分失控的 Agent 和忙碌的工程师。它直接作用于已流经网关的流量,无需任何设置。
User Insights 追踪成本,包括浪费发生在哪里,例如缓存命中率低和上下文窗口过大。很多工具已经能做到这一点。但它们无法告诉你账户是否表现正常。这正是我们选择与成本控制一起重点关注的方面。
每个账户都会随着时间留下行为指纹,无论它是一个人还是一个 Agent。每三小时汇总工单的 Agent 紧凑且一致。人则更混乱,prompt 多种多样,时间不规律,在难题上花费长时间。两者都是合法的,因此相同的偏差对一个人是噪音,对另一个人却是真正的信号。
在 User Insights 中,我们从为会话评分开始,而不是单个请求。绝对阈值在这里不起作用:重度用户的 $500 跳跃可能是正常的,而一个通常只花 $5 的 Agent 的 $50 会话是 10 倍的变化,否则可能会被忽视。因此,我们将每个会话与账户自己的历史进行比较,使用过去 30 天的第 95 百分位(p95)会话成本。这让我们了解账户的正常运作方式,任何超过其 p95 2 倍的都是异常行为的强烈候选。
以下分析阐述了我们如何得出这些数字。
Figure 1: Session Cost Anomaly Detection

如何阅读上图
该图表绘制了我们内部流量中的真实会话。每个点代表一个独立的会话(在对数刻度上绘制):
两条虚线阈值将会话分为四类:
Figure 2: Account-level Session Cost Distribution

此直方图(图 2)将整个组织的每个会话成本进行映射,以建立账户级别的上限:
那么为什么我们选择 p99?将绝对美元上限设置在账户 p99 创建了一个有意义的门槛。它保证异常不仅仅是某个特定用户的突然变化,而且在整个组织中也是最昂贵的 1% 会话之一。
Figure 3: Single User Session History

基准不是静态的。随着账户习惯的变化,其滚动 p95(绿线)和 2 倍阈值(橙线)也随之移动,因此警报始终反映最近的行为,而不是一次设定的数字。我们还应用了一个美元下限,因此峰值必须同时在统计上异常且值得管理员花时间调查。正是这个美元下限阻止了微型用户几分钱的 500 倍波动触发警报。
在上述所有分析之后,管理员看到的是过滤掉所有正常行为后偏离自身模式的账户视图。这个过滤后的视图就是异常行为信息流。
Company overview showing anomalous behaviors

这种行为很难捕捉,因为信号从来不是新工具或被阻止的操作。它是一个受信任的账户在做更多它已被允许做的事情。它可能是一个突然开始运行更昂贵会话的服务账户,或者是一个使用量远超自身正常水平并持续数天的人。
Anomalous behaviors broken down by session

这些都不会触发策略,但它们都打破了行为基准。账户突然偏离自身使用模式通常是凭据泄露或 Agent 失控的第一个可观察信号。
User Insights 不判断意图,也不阻止任何人;相反,它将少数开始表现异常的账户推到管理员面前,以便有人可以提出后续问题。有时这会导致真正的调查。有时这只是意味着某人需要指导(比如那个无论何时都将整个代码库塞进 prompt 而只需一段代码就能解决问题的开发者)。
一旦你设置了预算,下一个自然的问题就是:如何以更低的成本获得同等质量的输出?并非每个请求都需要前沿模型。摘要任务或简单的代码补全可以在更便宜的模型上运行,而不会有明显的质量损失。
我们正在构建基于任务的智能路由,AI Gateway 分析传入的请求并将其路由到以最低成本给你最佳结果的模型。在组织层面,你将能够看到通过路由到更高效的模型可以在哪里获得最大的节省。基于任务的智能路由正在积极开发中。随着它成熟,我们将分享更多。
异常检测告诉你某个账户打破了其模式,但不告诉你为什么。管理员仍然需要深入日志并拼凑发生了什么。弥合这一差距是我们下一步关注的重点,而这从对流量实际内容进行分类开始。
我们正在构建 prompt 分类,将请求分类为 coding、writing 等类别。这些类别是几乎所有其他信号都缺少的上下文。工程师在"coding"类别中的支出飙升可能是可以接受的,但同一账户从未接触过的类别出现同样的飙升则不可接受。分类可以向组织展示的不仅是它使用了多少 AI,还有它用 AI 来做什么。
它也回答了大多数对话背后的一个问题:AI 是否被用于预期的工作?一旦业务流量与其他一切分开,个人使用就变得可见。从外部看,在公司时间做私活的人和通过模型悄悄转移数据的人看起来是一样的。区分它们对于发现内部风险至关重要。
一旦你的 AI 流量通过 AI Gateway 运行,每个新的风险或效率信号类别都是管理员无需额外设置就能获得的更多信息。
User Insights 今天已面向每位 AI Gateway 客户正式发布,无需额外费用。它已在仪表板中供任何通过网关发送流量的人使用,因此如果你已经通过 AI Gateway 路由,这个视图对你可用。
如果你还没有这样做,创建一个网关并开始向我们的目录中的任何模型发出请求。
我们建议你将 AI Gateway 放在 Cloudflare Access 后面,后者现已开放公测。支出和异常视图可以在没有它的情况下工作,但附加身份是将匿名账户 ID 转变为你可以实际采取行动的名称的关键。先在监控模式下开始,了解你的基准,然后再强制执行任何策略。
我们想听听你今天如何管理 AI。加入 Discord 的对话或联系你的客户团队。