AgentReady 工具用 6 个真实请求(含 5 个真实 AI Bot UA)检测 robots.txt 声明与 CDN 实际放行状态是否一致。
每周的日志里都会出现新的 AI 爬虫:ClaudeBot、GPTBot、OAI-SearchBot、PerplexityBot、Google-Extended。你的 robots.txt 也许放行了所有这些爬虫——但 CDN 可能已经在边缘节点返回了 403 挑战页面,爬虫根本还没看到你的内容。没有人会去检查这个矛盾,因为它意味着真的要发起请求,而不是解析一个文本文件。
所以我做了 AgentReady:你给它一个 URL,它会发起六次真实的 HTTP 请求——一次模拟正常浏览器,五次使用 ClaudeBot、GPTBot、OAI-SearchBot、PerplexityBot 和 Google-Extended 实际发布的 User-Agent——再加上对 robots.txt、llms.txt、llms-full.txt、sitemap.xml 和 security.txt 的检查。数据是从我们自己的服务器实时获取的(没有任何域名会给一个从未听说过的站点发 CORS 头),所以不存在缓存或猜测。
它实际测量的内容,按权重排序:
User-Agent 对等性 — 每个爬虫实际收到的状态码和内容长度,与浏览器收到的对比。是正常服务了 / 被拦截了 / 还是内容过薄。
无需 JavaScript 执行就能获取的文本
根域名下的 robots.txt,按 User-Agent 分别检查,包括 Cloudflare 的 Content-Signal 头
JSON-LD 中声明的结构化数据和价格,而不仅仅是渲染到屏幕上的内容
<main> 内部 content tokens 与总 tokens 的比例
发现文件(discovery files)和基本的语义结构
输出是一个 0-100 的分数,分数的提升按可挽回的分数排序,而不是简单的检查清单。
我用它跑了一些知名网站:nytimes.com 得了一个 D(58 分)—— 五个 AI 爬虫中有四个在边缘节点直接收到了 403,而 robots.txt 禁止了一切。stripe.com 得了 A+(93 分)。
有必要提前说明:这个领域已经拥挤了。市面上有一大堆免费的 robots.txt 解析器,crawlreadiness.com 做的也与此非常接近(32 个爬虫、真实请求、打分、付费层级有每日免费限额)。AgentReady 是免费的,不需要登录,它生成的徽章本意是放在自己的网站上——但我不认为这里有什么护城河。我真正觉得有价值的是另一个项目:The Agent Web Index——同样的测量方式,但持续运行在整个互联网上,做成公开索引而非一次性检查。这个才是目前没有人做的事情。
很好奇大家还希望在按爬虫的细分报告里加哪些检查项,或者我漏掉了哪些爬虫。