探讨传统 robots.txt 在 AI 数据采集时代的局限,以及新标准的发展方向。涉及网站开发者和数据爬虫的权益平衡。
三十年来,robots.txt 一直是网站用来表明自动化爬虫应如何行动的主要机制。它诞生于 1994 年,当时的 Web 与今天截然不同:网页由轻量级 HTML 构成,自动化工具的行为可以预测,索引需求也相对简单直接。
2026 年的抓取趋势正在迅速变化。AI 系统不只是获取页面,还会提取文本、总结内容、裁剪图片,并将数据送入训练流水线。更重要的是,作为新兴 Agentic AI 趋势的一部分,这些操作无需人工干预便可自动完成。显然,我们需要一套用 AI 抓取数据的新标准。
就目前而言,robots.txt 抓取策略存在一些结构性限制,而这些问题在现代 AI 的背景下愈发明显:
**它只能控制访问,不能控制用途:**该文件可以告诉 bot 是否可以获取某个 URL,却无法区分不同的使用目的。网站所有者无法表达类似“可以为搜索建立索引,但不得用于模型训练”的要求。
**它没有语义层:**robots.txt 会以相同方式对待整个 URL,但一个页面可能同时包含文本、代码片段、图片或用户生成内容,而网站所有者可能希望以不同方式处理这些内容。
**它依赖自愿遵守:**传统搜索引擎通常会遵守 robots.txt,但许多较新的 AI 爬虫并不会这样做。杜克大学最近的一项研究(2025 年)发现,有几类 AI 相关爬虫甚至从不请求 robots.txt。
由于这些问题,网站所有者希望能以更清晰的方式表达哪些行为是允许的,哪些是不允许的。这一转变促使研究人员和开发者开始探索 robots.txt 的替代方案或补充方案,其中包括 ai.txt 和 llms.txt。
ai.txt 提案(《用于指导 AI 与互联网交互的领域特定语言》,2025 年)引入了一种 Domain-Specific Language,用于声明网站允许哪些类型的 AI 交互。它的目标不只是阻止或允许访问 URL,而是以更细致的方式描述被允许执行的操作。
借助 ai.txt,网站可以在不同层级指定规则。例如,允许对文章进行总结,但禁止提取图片;或者允许将某个版块用于训练,同时限制另一个版块。该格式还支持面向合规 AI Agent 的自然语言指令,提供了 robots.txt 永远无法实现的灵活性。简而言之,它可以用于:
指定哪些类型的内容可以或不可以使用,例如允许使用文本、禁止使用图片。
定义 AI 系统可以执行哪些操作,例如可以总结,但不能用于训练。
为页面的特定版块或元素设置规则。
直接在文件中提供使用条款或许可说明。
目前提出了两种规则执行路径:
**程序化解析:**AI Agent 读取 ai.txt 的结构化表示形式(例如 XML),并自动执行其中的规则。
**基于 prompt 的规则执行:**将 ai.txt 文件作为纯文本读取,并将其纳入 Agent 的指令中。
ai.txt 关注的是限制,而 llms.txt 关注的是清晰度。
llms.txt 最初由 Jeremy Howard 提出,是一个放置在网站根目录下的简单 Markdown 文件。它不会迫使 AI 系统抓取整个页面,而是向其提供网站核心内容的简明概览。
一个典型的文件可能会先提供项目的简短摘要,然后给出文档、示例、参考页面或其他重要版块的链接。由于它使用 Markdown,因此人们很容易阅读,模型也很容易解析。简而言之,它可以:
向 AI 清晰概述网站是什么,以及其中包含哪些内容。
指向最重要的页面,如文档、指南和参考资料。
标明应当依赖哪些 URL 作为“canonical”来源。
通过提供经过筛选的列表,帮助模型避免抓取嘈杂或无关的页面。
它不能取代 robots.txt 抓取策略,也不负责管控访问。它扮演着不同的角色:提供一个清晰的入口,让 AI 系统可以依赖经过筛选的内容大纲,而不必完整抓取网站。当 LLM 引用网站内容时,这种方式可以减少幻觉,并提高回答的准确性。
robots.txt 的各种替代和补充工具目前都属于自愿遵守的约定,主要在科技和 SEO 社区中得到采用。例如,Yoast SEO 插件增加了一项功能,可以在网站根目录下自动生成 llms.txt。
然而,到目前为止,实际的 AI 提供商并未普遍遵守这些文件。SearchEngineLand 在 2025 年报道称,“没有明确证据表明 AI 公司会遵守 llms.txt”规则,并指出 Google 已明确表示不支持 llms.txt。大型平台没有采用 ai.txt 或 llms.txt,而是提供开发者文档或爬虫规则,以实现类似的控制能力,并调整 robots.txt 抓取策略。
各国政府才刚刚开始关注这一问题。在英国,包括 Guardian News & Media 在内的出版商已经呼吁政策制定者支持类似 ai.txt 的标准。他们向英国议会委员会提交的材料将 ai.txt 描述为一种覆盖面广、对行业友好的解决方案,并指出大型科技公司当前提出的方案并不能完全满足出版商的需求。
不过,目前还没有任何国家强制要求使用 ai.txt 或 llms.txt。尽管 AI 抓取技术不断演进,但 2026 年 robots.txt 的发展趋势仍不明朗。在美国,监管机构主要关注自愿披露和透明度指南。截至 2025 年末,这两种格式都尚未做好成为 AI 数据抓取新标准的准备。情况不太可能早在 2026 年就发生改变,但未来最终出现一套统一系统仍有可能。
[1]《爬虫选择性遵守 robots.txt 指令:一项大规模实证研究的证据》,Taein Kim,杜克大学,2024 年
[2]《独家:授权公司称,多家 AI 公司绕过 Web 标准抓取出版商网站》,Reuters,2024 年
[3]《LLMs.txt 目录》,llmstxt.cloud,2024 年
[4]《什么是 llms.txt?这项新 AI 标准如何运作》,Bluehost,2025 年
[5]《Google AI 与 LLMs.txt 尚未实现》,Search Engine Roundtable,2024 年
[6]《关于 AI 与 Web 标准的书面证据(论 robots.txt 与 llms.txt 的重要性)》,英国议会委员会,2024 年
部分评论可能仅对已登录的访客可见。请登录以查看所有评论。
如需采取进一步行动,你可以考虑屏蔽此人和/或举报其滥用行为。