Cloudflare 发布 BotBase 和 Precursor 系统,将 Bot 评估从单点风险判断转向持续信任评估,并提供模拟工具。
互联网并非只有一条车道。长期以来,Web 安全领域有一个经验法则:机器人是坏的,人类是好的。当然,我们早已超越了这一笼统概括。人类可以欺诈,机器人也可能在不同层面是有益的。站点所有者实际上希望有一些自动化流量与我们的站点互动,使互联网正常运行并可被发现。
更复杂的是,"人类"与"机器人"之间的界限正变得越来越模糊。现在,我们有一种"混合"流量,单个会话会在人类和代理之间来回切换。(想象一下,用户在浏览一个商店,然后把结账流程交给一个自动化的购物助手。)
那么,网站所有者如何管理这种复杂性?这里重要的是评估行为。这个行为是否滥用?是否恶意?这里呈现的风险是什么?我能否根据访问者的行为信任他们?解决这一问题需要超越静态的、一次性检查。它需要分析持续性行为来评估 Trust。
在这篇文章中,我们将分享 Web Integrity & Trust 团队(在机器人检测和欺诈领域)的策略内幕,探讨如何检测和分析好的与坏的行为,为站点所有者提供应对不断变化的 Agentic Internet 中新兴挑战的工具。我们还将分享自 Precursor 发布以来的代理流量发现,以及一个模拟演示——您可以在这里看到自己的光标移动如何被评估为人类或机器人——以及近期即将推出的一些令人兴奋的发布更新。
让我们谈谈 Cloudflare 负责机器人检测的团队内部如何讨论 Risk 与 Trust 的区别。这两者通常被视为一个连续体上的两个极端。在 Cloudflare,我们将它们视为独立的、但相互关联的值。Trust 是对流量做出明智决策的关键要素。
Risk 是某个请求或行为造成伤害的可能性,它往往是短暂的。然而,Trust 是随时间积累的,它基于信誉。
我们可以用现实生活中的一个例子来说明:假设您正在家中享受晚间电视,突然听到门铃被反复按响。除了烦人之外,这种行为也很奇怪。深夜疯狂按门铃是令人警觉的。
您通过门铃摄像头查看,看到按门铃的人是住在您隔壁的最好的朋友。当然,您信任您最好的朋友,我们打赌您会让他们进来。
在这个例子中,仅仅说"拒绝任何在夜间按门铃的人"或"拒绝任何按门铃超过 10 次的人"是不够的。同样,Trust 是关键要素。
回到互联网流量,我们构建机器人和欺诈领域产品的策略聚焦于建立基于 Trust 的完整生态系统。我们的目标是提供激励和原语,供站点所有者使用,以激励使互联网对每个人都更安全的行为:从底部的阻止恶意活动开始,到顶部的鼓励参与更安全的互联网。
从顶部最高 Trust 行为到底部不受信任的恶意行为的 Trust 频谱。额外的列表示站点所有者通常如何处理该行为。

从顶部开始:什么算作好的行为?我们可以从 BotBase 中的已验证机器人和代理中找出清晰的例子。上个月,我们宣布了针对系统中追踪的好机器人的更新实用分类法,将"已验证"的定义简化为两件事:1)您诚实声明自己;2)您不滥用您赢得的信任。
站点所有者与机器人运营商之间的透明允许建立共生关系:站点所有者可以注明他们希望在网站上允许哪些行为和数据使用,机器人运营商可以更轻松地获得访问。透明允许建立关系中的 Trust;如果您没有什么可隐瞒的,声明您是谁应该减少想要允许您行为的站点的摩擦。
BotBase 不仅仅是为了声明"谁是好机器"。它旨在成为所有已知机器人和代理的目录,并提供事实。与我们之前仅包含已知好机器人的 Bots Directory 相比,BotBase 还能够追踪不太好机器人和代理。为什么?因为我们的系统为已知好行为者追踪和验证行为,这意味着我们有能力识别这些期望何时未得到满足。如果您在 Cloudflare 网络上滥用信任,您不应该被轻易允许,因此您将是不被验证的。
几周前,我们宣布了 Precursor,这是一个持续的客户端系统,可以检测即使是非常微妙的非人类机器人流量——这类流量在仅评估网络信号时可能会逃过检测。当客户启用 Precursor 时,JavaScript 检测由 CDN 注入,因此不需要坐在电脑前弄清楚在哪里或如何重新运行这些检测。更重要的是,Precursor 在整个会话期间持续评估用户行为,因此不会再为找到方法一次性通过客户端和浏览器端检查的滥用流量提供免费通行证。
将我们的 Risk 与 Trust 框架应用于这些客户端检测,我们可以指出 CAPTCHA 或一次性障碍是 Risk 驱动的,这意味着它们缺乏上下文。另一方面,使用行为线索进行验证是 Trust 驱动的,因为它可以从完整的用户会话中捕获更多上下文线索。Precursor 是我们分析此行为的工具。总而言之,Precursor 如此强大是因为它:
提供基于整个用户会话的 Trust 检测。
提高了机器人开发者在多页面时间线上复制人类行为的成本。
通过使机器人开发者超越这些检测在经济上处于不利地位,我们赢得了对抗游戏。
那么,自发布以来我们学到了什么?在我们撰写这篇博客的仅仅 24 小时内,我们可以看到 2.06 亿次 Precursor 评估事件,跨越 Cloudflare 网络上的 73,438 个区域。
一张 24 小时内 Precursor 使用统计数据的截图。

我们可以在数据中看到一些模式,这些模式揭示了我们在发布检测时怀疑但现在可以在数万个域上验证的事情:
可疑行为通常发生在会话中期,而一次性检测不会捕获这些行为。
行为通常在一个会话中从人类切换到代理再切换回来。在这些情况下,重要的是理解意图,这样站点所有者就不会阻止他们实际想要的用户流。这凸显了机器人分类系统的重要性——允许网站所有者按用例、目的和数据使用来处理流量。这正是我们优先更新 BotBase 分类法的原因。
这凸显了机器人分类系统的重要性,允许网站所有者按用例、目的和数据使用来处理流量。这正是我们优先更新 BotBase 分类法的原因。
对于那些好奇 Precursor 实际如何工作的人,我们在发布公告博客文章中分享了一个预告——我们分析的信标如何向我们表明犯错是人类本性。今天,我们更进了一步:让互联网上的任何人都可以使用一个交互式演示,模拟 Precursor 如何追踪您的光标移动。
自定义光标移动被 Precursor 评估的截图。

Precursor Trace 现已上线,分享我们将如何使用 Precursor 检测机制的(部分)来评估您的光标移动。在这里,您可以了解您是在加速还是纠正自己、您的光标移动的节奏和纹理,等等——所有这些作为真实人类与计算机交互时您可能从未想过的事情。快去试试吧!
Cloudflare 的机器人检测引擎在评估给定请求是否自动化时可能产生不同的结果。对于被认为自动化的请求,评估可以是:1)确定是自动化的,基于已证实的确定性方法或机器人指纹;或 2)可能是自动化的,基于 Cloudflare Bots ML 的预测评分。
从历史上看,Bots ML 是按版本更新的,这意味着我们将每个新模型版本作为产品发布来宣布。当机器人按小时甚至分钟来适应时,这种节奏是行不通的。
Adaptive Intelligence,一个全新的检测引擎,与我们之前在 Bots ML 领域构建的任何东西都不同。模型本身是自适应的。它从我们过去看到的一切中学习,但更重要的是,它将继续学习并根据所见进行自我调整。Adaptive Intelligence 将根据我们识别的广泛流量模式(从好到坏的行为)自行升级,客户将不再需要升级到正式的新模型版本才能使用最新的预测机器人检测为您服务。
所有 Bot Management 客户将在不久的将来获得 Adaptive Intelligence 访问权限——请继续关注即将发布的公告。
到目前为止,我们专注于 Cloudflare 方面:策略、检测和分类法。所有这些都允许 Cloudflare 为网站所有者配备他们需要的工具,在他们的网站上设置他们想要的流量策略。深入到网站所有者方面,我们想借此机会讨论一些高级缓解措施,让网站所有者自己能够影响机器人行为。
对于更明目张胆的缓解技术,我们面临着我们称之为"机器人抗生素问题"的东西。总是向机器人发送确定性响应(如 403 阻止)使得恶意开发人员机器人容易探测、观察和反向工程您的防御。
我们知道这一点,因此我们正在设计专门为节流机器人而制的缓解措施——对恶意机器人和良性机器人采用不同方法。我们可以将它们分解为三种方法:
方法 1:不可预测性和随机操作。 对可疑自动化流量应用随机响应(在阻止、挑战或允许之间)会破坏机器人的自动重试逻辑和指纹识别。
方法 2:AI Labyrinth,一种防御性响应,将未授权机器人困在由 AI 生成的网页无尽迷宫中。您可以通过误导来浪费恶意机器人的计算和爬取预算。站点所有者将获得 AI Labyrinth 中的三个选项,根据他们的偏好:
方法 3:为好机器人排队。 并非所有代理流量都是坏的;排队管理合法自动化流量(如用户导向的购物代理)的吞吐量,而不完全拒绝其服务。
这些高级的、针对机器人的缓解措施预计将在今年年底左右推出,网站所有者将可以选择他们希望缓解措施有多严格。
我们也知道一个伟大的防御是预测性的——一个自我学习并自我纠正的防御,不需要多个安全专家在电话中被动地设置一个考虑最新隐蔽攻击的修复程序。这看起来可能像是一个"一次性"规则系统,其中规则集本质上是动态的。这是设计使然:如果攻击不断演变,防御也应该如此。这就是为什么我们努力保持检测和缓解都领先一步。
任何人都可以采取步骤来定义自动化代理如何与他们的基础设施互动。
玩玩 Precursor Trace
通过摆脱静态的、一次性检查,采用持续的 trust 评估,我们减少了与机器人运营商的打地鼠游戏。如果您还没有使用 Cloudflare 的机器人检测,请去看看,建立适合您的 Trust 生态系统。
