报道 OpenAI 爬虫行为对小公司服务造成 DDoS 级负荷的事件。引发关于 AI 模型训练数据采集合理性和网站防护的讨论。
周六,Triplegangers CEO Oleksandr Tomchuk 收到通知,称公司的电商网站宕机了。看起来像是遭遇了某种分布式拒绝服务攻击(DDoS)。
他很快发现,罪魁祸首是 OpenAI 的一个 bot,它正锲而不舍地尝试抓取他那规模庞大的整个网站。
“我们有超过 65,000 件产品,每件产品都有一个页面,”Tomchuk 告诉 TechCrunch,“每个页面至少有三张照片。”
OpenAI 发出了“数以万计”的服务器请求,试图下载网站上的所有内容,包括数十万张照片及其详细描述。
“OpenAI 使用了 600 个 IP 来抓取数据,而且我们仍在分析上周的日志,实际数量可能远不止这些,”他在谈到该 bot 试图抓取网站时所使用的 IP 地址时说。
“它们的爬虫快把我们的网站压垮了,”他说,“这基本上就是一次 DDoS 攻击。”
Triplegangers 的网站就是它的业务本身。这家只有七名员工的公司花了十多年时间,建立了其所谓的全网最大“人类数字替身”数据库,也就是由真人模特扫描而成的 3D 图像文件。
它向 3D 艺术家、电子游戏开发商,以及任何需要以数字方式真实再现人类特征的人,出售 3D 对象文件和照片——从手、头发、皮肤到完整人体,应有尽有。
Tomchuk 的团队位于乌克兰,同时也在美国佛罗里达州坦帕获得了经营许可。其网站的服务条款页面明确禁止 bot 未经许可获取网站图片。但仅凭这一点毫无作用。网站必须使用正确配置的 robot.txt 文件,并添加专门要求 OpenAI 的 bot——GPTBot——不要抓取该网站的标签。(根据 OpenAI 介绍其爬虫的信息页面,OpenAI 还有另外几个 bot,包括 ChatGPT-User 和 OAI-SearchBot,它们各自都有对应的标签。)
Robot.txt 也称为 Robots Exclusion Protocol,最初是为了在搜索引擎索引 Web 时,告诉它们哪些内容不应抓取。OpenAI 在其信息页面上表示,只要文件中配置了 OpenAI 自己规定的禁止抓取标签,它就会遵守这些文件;不过 OpenAI 也警告称,其 bot 最长可能需要 24 小时才能识别更新后的 robot.txt 文件。
正如 Tomchuk 的经历所表明的那样,如果一个网站没有正确使用 robot.txt,OpenAI 和其他公司就会将其理解为:它们可以随心所欲地抓取。这并不是一个需要主动授权的 opt-in 机制。
更雪上加霜的是,Triplegangers 不仅在美国工作时间被 OpenAI 的 bot 搞到宕机,Tomchuk 还预计,由于该 bot 带来的大量 CPU 运算和下载活动,公司的 AWS 账单也会大幅上涨。
Robot.txt 也不是万无一失的保障。AI 公司只是自愿遵守它。去年夏天,另一家 AI 初创公司 Perplexity 就曾因 Wired 的一项调查而受到广泛批评,因为一些证据表明 Perplexity 并没有遵守该协议。
到了周三,在 OpenAI 的 bot 连续几天反复来访之后,Triplegangers 终于部署了正确配置的 robot.txt 文件,还设置了 Cloudflare 账户,用于屏蔽 GPTBot,以及 Tomchuk 发现的其他几个 bot,例如 Barkrowler(一个 SEO 爬虫)和 Bytespider(TokTok 的爬虫)。Tomchuk 也希望自己已经成功屏蔽了其他 AI 模型公司的爬虫。他表示,周四早上网站没有再崩溃。
但 Tomchuk 仍然没有合理的办法查明 OpenAI 究竟成功拿走了哪些内容,也无法要求其删除这些材料。他找不到任何联系 OpenAI 并提出请求的途径。OpenAI 没有回应 TechCrunch 的置评请求。而且,正如 TechCrunch 最近报道的那样,OpenAI 迄今仍未推出其承诺已久的 opt-out 工具。
对 Triplegangers 来说,这是一个尤其棘手的问题。“我们从事的业务对权利问题相当严肃,因为我们扫描的是真实的人,”他说。根据欧洲 GDPR 等法律,“它们不能随便拿走 Web 上任何人的照片并加以使用。”
Triplegangers 的网站对 AI 爬虫而言也是一座格外诱人的宝库。像 Scale AI 这样估值数十亿美元的初创公司,其业务正是让人类煞费苦心地为图像添加标签,以训练 AI。而 Triplegangers 的网站包含大量已被详细标注的照片:族裔、年龄、纹身与疤痕的区别、各种体型,等等。
讽刺的是,恰恰是 OpenAI bot 的贪婪,让 Triplegangers 意识到自己暴露得有多彻底。Tomchuk 表示,如果它抓取得更温和一些,他可能永远都不会察觉。
“这很可怕,因为这些公司似乎正在利用一个漏洞来抓取数据。它们说,‘只要在 robot.txt 中加入我们的标签,你就可以选择退出’,但这等于把责任推给了企业主,要求他们自己弄明白如何屏蔽这些爬虫,”Tomchuk 说。
他希望其他在线小企业明白,要发现 AI bot 是否正在拿走网站上受版权保护的资产,唯一的办法就是主动检查。被这些 bot 折磨的当然不只他一个。其他网站的所有者最近也向 Business Insider 表示,OpenAI 的 bot 导致他们的网站崩溃,还推高了 AWS 账单。
这个问题在 2024 年出现了数量级上的恶化。数字广告公司 DoubleVerify 的一项新研究发现,AI 爬虫和数据抓取程序导致 2024 年的“常规无效流量”增加了 86%——也就是并非来自真实用户的流量。
尽管如此,Tomchuk 警告称:“大多数网站仍然完全不知道自己已被这些 bot 抓取。现在,我们不得不每天监控日志活动,寻找这些 bot。”
仔细想想,这整套模式有点像黑手党敲诈:除非你采取保护措施,否则 AI bot 想拿什么就拿什么。
“它们应该先征得许可,而不是直接抓取数据,”Tomchuk 说。
TechCrunch 推出了专注于 AI 的 newsletter!立即注册,即可每周三在收件箱中收到它。