AI 爬虫滥用网站资源,OpenAI 和 Meta 最甚
深度调查指出 AI 爬虫对网站造成严重流量压力,OpenAI 和 Meta 爬虫行为最频繁,对网站防护和流量管理策略有启示
深度调查指出 AI 爬虫对网站造成严重流量压力,OpenAI 和 Meta 爬虫行为最频繁,对网站防护和流量管理策略有启示
有一个抓取机器人每分钟向某个网站发起 39,000 次请求
更新 云服务巨头 Fastly 发布了一份报告,称 AI 爬虫正在给开放 Web 带来沉重负担。它们大肆抓取网站,占全部 AI 机器人流量的 80%,其余 20% 则来自 AI fetcher。机器人和 fetcher 可能会猛烈冲击网站,每分钟向单个站点索取数千次数据。
报告称,Facebook 母公司 Meta 的 AI 部门贡献了超过一半的爬虫流量,而 OpenAI 则占据了绝大多数按需抓取请求。
Fastly 高级安全研究员 Arun Kumar 在报告发布时的一份声明中表示:“AI 机器人正在重塑人们访问和体验互联网的方式,也给数字平台带来了新的复杂性。无论是抓取训练数据,还是提供实时响应,这些机器人都给可见性、控制和成本带来了新的挑战。你无法保护自己看不见的东西;在缺乏明确验证标准的情况下,由 AI 驱动的自动化风险正成为数字团队的盲区。”
该报告基于对 Fastly Next-Gen Web Application Firewall(NGWAF)和 Bot Management 服务的分析。Fastly 表示,这些服务“保护着超过 130,000 个应用和 API,每月检查超过 6.5 万亿次请求”——这为其提供了大量可供分析的数据。数据揭示了一个日益严重的问题:越来越多的网站负载并非来自人类访客,而是来自代表聊天机器人公司工作的自动爬虫和 fetcher。
Fastly 的报告警告称:“一些 AI 机器人如果没有经过谨慎设计,可能会在无意间给 Web 服务器施加不可持续的负载,导致性能下降、服务中断和运营成本增加。”Kumar 还单独向 The Register 表示:“显然,这种增长是不可持续的。它不仅带来了运营挑战,还破坏了内容创作者的商业模式。作为一个行业,我们需要做得更多,建立负责任的爬取规范与标准,让 AI 公司能够获得所需数据,同时尊重网站的内容使用准则。”
这些不断增长的流量只来自少数几家公司。仅 Meta 一家就占据了全部 AI 爬虫流量的 52%,随后是 Google 和 OpenAI,分别占 23% 和 20%。这三家公司合计掌握了 95% 的 AI 爬虫流量。相比之下,Anthropic 只占爬虫流量的 3.76%。Common Crawl Project 抓取网站并将内容纳入一个免费的公共数据集,旨在避免重复劳动,以及爬虫问题核心所导致的流量成倍增加;但它的占比低得令人意外,只有 0.21%。
到了 AI fetcher 这里,情况则完全相反。与爬虫不同,当用户要求模型引入训练数据截止日期之后的新信息时,fetcher 才会按需启动。Fastly 发现,在这一领域,OpenAI 遥遥领先,占全部请求的近 98%。这或许说明,OpenAI 凭借 ChatGPT 率先进入面向消费者的 AI 聊天机器人市场,为公司带来了多么巨大的领先优势;也可能只是说明,该公司的机器人基础设施需要优化。
Kumar 表示,AI fetcher 在 AI 机器人请求中只占少数——约为 20%——但它们可能制造极为庞大的流量峰值。在测试期间,有一个 fetcher 每分钟生成了超过 39,000 次请求。Kumar 告诉 The Register:“随着 AI 工具得到更广泛的采用,以及更多在用户与网站之间充当中介的 Agent 工具投入使用,我们预计 fetcher 流量还会继续增长。”
Perplexity AI 最近被指控使用其公开爬虫 IP 地址范围之外的 IP 地址,并且无视希望拒绝被抓取的网站所设置的 robots.txt 指令。在该报告记录的流量中,Perplexity AI 仅占 AI 爬虫机器人流量的 1.12%,以及 AI fetcher 机器人流量的 1.53%——不过报告指出,这一比例正在增长。
Kumar 谴责了无视 robots.txt 说明的做法。他对 El Reg 表示:“至少,今天任何一家信誉良好的 AI 公司都应该遵守 robots.txt。更进一步,也是更关键的一点是,它们应该公布自己的 IP 地址范围,而且它们的机器人应该使用唯一名称。这将帮助网站运营者更好地区分正在爬取其网站的机器人,并允许他们利用机器人管理解决方案实施细粒度规则。”
但他并未主张强制推行标准,而是表示行业论坛正在研究解决方案。“我们需要让这些流程充分推进。把技术标准强制写入监管框架往往不会产生好的结果,也不应该成为我们的首选手段。”
这个问题的规模已经大到用户开始反击。面对肆意践踏 robots.txt 指令等礼貌退出机制的机器人,网站管理员正越来越多地采用主动反制措施,例如基于工作量证明的 Anubis,或者向机器人灌输乱码、将其困住的 Nepenthes;与此同时,Fastly 的竞争对手 Cloudflare 一直在测试按爬取次数收费的方案,试图让机器人运营者承担经济成本。Fastly 的报告警告称:“使用这些技术时必须谨慎,以免意外屏蔽合法用户,或降低他们的使用体验。”
Kumar 指出,小型网站运营者最有可能受到严重影响,尤其是那些提供动态内容的网站。他也给出了一些建议:“第一步,也是最简单的一步,是配置 robots.txt,这能立即减少行为规范的机器人所产生的流量。如果具备相应的技术能力,网站还可以部署 Anubis 等控制措施,以帮助减少机器人流量。”不过他也警告,机器人一直在进步,并试图寻找绕过 Anubis 这类“tarpit”的方法,代码托管网站 Codeberg 最近就经历了这种情况。“这形成了一场持续不断的猫鼠游戏,与我们今天在其他类型机器人身上观察到的情况类似。”他说。
我们采访了 Anubis 开发者、Techaro CEO Xe Iaso。当我们询问他们是否预计爬虫流量的增长会放缓时,他们回答说:“我只看到一种可能让这一切停下来的情况:AI 泡沫破裂。”
“除此之外,实在是有太多炒作,在推动人们使用更糟糕的文档、电子邮件和网站版本。我不知道这实际上给人们带来了什么,但我们的行业却对此深感自豪。”
不过,他们补充道:“我看不出它有什么理由不继续增长。人们正在用这些工具取代知识和技能积累。没有理由认为,这场针对我们文化中节俭观念的攻击不会继续下去。这是针对中层管理者的完美攻击:这些不眠不休的自动机器永远不会生病,不会休假,也不需要为它们支付健康保险,却能产出表面上类似于人类员工成果的内容。我看不出这种情况有什么理由不会继续增长,除非 AI 泡沫破裂。即便如此,其中许多抓取程序可能仍会继续运行,直到背后的风险投资耗尽。”
The Register 询问 Xe,他们是否认为更广泛地部署 Anubis 和其他主动反制措施会有所帮助。
他们回答说:“这是一个监管问题。真正需要发生的是,各国政府必须介入,对这些正在破坏数字公共利益的 AI 公司处以足以威胁其生存的罚款,并要求它们向受到伤害的社区支付赔偿。讽刺的是,大多数 AI 公司都依赖于它们正在摧毁的社区。
“这种悖论,本应出现在 Neal Stephenson 20 世纪 90 年代的小说里,而不是 CBC 的头版上。Anubis 通过提高攻击所需的计算成本,帮助缓解了许多恶劣影响。Anubis 即使采用不包含工作量证明的配置,也会迫使攻击者重新改造抓取方案,使用 headless browser,而不是盲目抓取 HTML。”
“这会提高那些传播滥用流量的 AI 公司的基础设施成本。我们希望,通过迫使 AI 公司投入更多硬件来解决这个问题,让抓取在经济上变得不可行。归根结底,它会迫使抓取程序花更多的钱,才能完成同样的工作。”
我们联系了 Anthropic、Google、Meta、OpenAI 和 Perplexity,但截至发稿时,没有一家公司就该报告发表评论。®
Cloudflare 产品副总裁 Will Allen 对这些发现发表评论称,Cloudflare 的观察结果与 Fastly 的说法“相当接近”,“名义上的差异可能源于客户构成不同”。Allen 补充说,根据 Cloudflare 自己按爬取目的统计的 AI 机器人与爬虫流量数据,在 4 月 15 日至 7 月 14 日期间,82.7% 的流量“用于训练——这相当于 Fastly 报告中的‘AI crawler’”。
当被问及爬虫流量是否可能继续增长时,Allen 回答说:“在可预见的短期内,我们没有看到任何实质性的放缓——目前对内容的需求似乎永无止境。”
他表示:“我们围绕 AI 爬虫开展的所有工作,都建立在一个极其简单的理念之上:当内容创作者和网站所有者把内容与数据发布到网上时,他们应该有权决定这些内容与数据如何被用于商业目的。我们中的一些人希望为超级智能写作,另一些人则希望建立直接联系,只为人类的眼睛创作。”
当被问及网站运营者应如何减轻这些流量给基础设施带来的负担时,他自然推销起了自家产品:“Cloudflare 让控制权变得极其容易掌握,即使是免费用户也一样:你可以决定允许所有人爬取,也可以一键阻止 AI Crawlers 获取训练数据,并部署我们完全托管的 robots.txt。”
谈到该公司的 AI 迷宫时,他表示,这“是我们利用 generative AI 阻止机器人的初步尝试,同时也会生成有价值的数据,反馈给我们的机器人检测系统。我们并不认为这是最终解决方案,而是把它视为一种有趣的技术应用,用来困住行为不当的机器人。”