安全研究者发现攻击者正大规模扫描GitHub等平台漏洞,同时伪装成ClaudeBot、GPTBot等AI爬虫以绕过检测。
互联网正迅速从一个主要为人类构建的环境,演变为机器越来越频繁使用的环境。了解 AI Agent、爬虫、网页抓取工具和其他 bot 如何重塑网络上信息的发现、访问和使用方式。
来自 5000+ 网站的关键生态系统指标,这些网站使用了 Agent Analytics 和 AI Chat Referral Tracking。
Bot 与人类流量对比
AI Chat 推荐量
Robots.txt 有效性
按 Agent 类型统计流量
悬停查看每种 Agent 类型的更多信息
活动最频繁的 Agent 类型
活动最频繁的 Agent
运营商活动排行
这些 bot 抓取网站内容用于训练 AI 模型。其中部分属于 AI 公司,部分属于转售数据的第三方服务。Robots.txt 可自动阻止不必要的抓取行为。包含的 Agent 类型包括 AI Data Providers 和 AI Data Scrapers。
按 Agent 类型统计流量
各 Agent 类型的 AI 抓取活动随时间变化
访问量最高的网站分类
活动最频繁的网站分类
AI 抓取量最大的 Agent
AI 抓取量最大的运营商
这些 bot 实时获取网站内容,为 AI 助手、编码 Agent 和其他检索增强生成(RAG)任务提供支持。页面即时为响应提供信息,例如助手总结文章或编码 Agent 参考文档时。包含的 Agent 类型包括 AI Assistants 和 AI Coding Agents。
按 Agent 类型统计流量
各 Agent 类型的 AI 获取活动随时间变化
访问量最高的网站分类
活动最频繁的网站分类
AI 获取量最大的 Agent
AI 获取量最大的运营商
AI 搜索引擎索引活动
这些 bot 抓取网站内容,以便在 AI 搜索引擎和 AI 生成的答案中呈现。这些答案通常包含对源页面的引用或链接。包含的 Agent 类型包括 AI Search Crawlers。
按 Agent 类型统计流量
各 Agent 类型的 AI 搜索引擎索引活动随时间变化
访问量最高的网站分类
活动最频繁的网站分类
AI 搜索引擎索引量最大的 Agent
AI 搜索引擎索引量最大的运营商
这些 bot 使用浏览器自主导航网站、点击页面并做出决策,以完成人类委托的任务。Agentic UX 最佳实践和 Google PageSpeed Insights 有助于评估网站对它们的支持程度。包含的 Agent 类型包括 AI Agents。
平均会话时长
每次会话平均页面数
按 Agent 类型统计流量
各 Agent 类型的 AI 浏览活动随时间变化
访问量最高的网站分类
活动最频繁的网站分类
AI 浏览量最大的 Agent
AI 浏览量最大的运营商
Robots.txt 与合规性
查看整个网络上设置了哪些 robots.txt 规则,以及 Agent 对它们的遵守程度。Agent 的 Robots.txt Effectiveness 衡量该 Agent 对被屏蔽规则的遵守效果,即估算该 Agent 被屏蔽后流量减少的程度。
总体有效性
AI 抓取工具和数据提供者的有效性
遵守规则排行前列的 Agent
Robots.txt Effectiveness 百分比最高的 Agent
违反规则排行前列的 Agent
Robots.txt Effectiveness 百分比最低的 Agent
被顶级网站屏蔽最多的 Agent 规则
顶级 1000 网站中在各 Agent robots.txt 中被屏蔽的百分比随时间变化
被最多顶级网站屏蔽的 Agent
查看被模仿最多的 Agent,以及欺骗活动如何随时间变化。当一次访问声称使用某个已识别 Agent 身份但未通过该 Agent 支持的身份验证方法(如已验证 IP 或 Web Bot Auth)时,该访问被视为欺骗。
按 Agent 身份统计的欺骗流量
各 Agent 身份被冒用的网站流量百分比随时间变化
被冒充最多的 Agent 身份排行
被冒充最多的 Agent 身份
最近被攻击最多的目标路径示例
最近被访问最多的请求路径示例
查看 ChatGPT、Perplexity 和 Gemini 等 AI 平台如何引用网站并为其带来人类引荐流量。引用数为估算值。Google 的指南说明了网站如何优化其内容以在 AI 聊天回复中获得更高可见度(GEO)。
按 AI 聊天平台统计流量
各 AI 聊天平台随时间的引荐活动
被提及(引用)最多的网站分类
在 AI 聊天回复中被引用最频繁的网站分类
被点击(引荐)最多的网站分类
从 AI 聊天获得最多引荐的网站分类
Index 每日更新,整合来自超过 5000 个使用 Agent Analytics 和 AI Chat Referral Tracking 的网站的已完成流量、安全和引荐数据。当天未完成数据不计入。百分比变化标签将当前时期与同等时长的前一时期进行对比。Agent 名称、运营商和分类来自 Agent Directory,该目录在新 Agent 被发现或现有 Agent 发生变化时更新。网站分类遵循 Google AdSense 使用的分类法。参与网站并非整个网络的随机样本,合格网站集可能随网站连接、断连或跨越活动阈值而变化。结果描述的是所观察网络的情况和更广泛的趋势方向;不应将其解读为全球网站流量的精确统计。
资格与聚合
仅包含满足最低活动量和数据质量要求的网站。内部、测试、不完整或异常数据被排除。Bot 流量百分比以服务器总流量为分母。AI 聊天引荐百分比以预估人类流量为分母,通过从服务器总流量中排除已识别的 bot 访问来计算。先为每个合格网站计算比率,然后在网站和完成日期上取平均值。这使每个网站具有相同的权重,无论其流量大小如何,并防止少量高流量网站主导结果。日线图不做平滑处理,使正常季节性变化保持可见。
Robots.txt 有效性测量
Agent 的 Robots.txt Effectiveness 估算全 Disallow 规则与其请求率降低相关的减少量。对于每个完成日期,Known Agents 从该 Agent 被允许的合格网站建立特定于该 Agent 的基线,调整该 Agent 被禁止的每个网站的总体流量基线,并比较预期活动与实际观察到的活动。只有满足足够网站流量、Agent 活动、跨站覆盖率和预期量的网站日观察才有资格。分数还需要多个网站和多天的重复观察。当 Agent 发布支持的身份验证方法时,只有经过验证的流量才归因于该 Agent。
每个合格的网站日贡献相等。分数范围从 0%(表示无明显减少)到 100%(表示在被禁止的 Agent 所在合格请求中没有观察到任何请求)。标题 Robots.txt Effectiveness 指标为每个合格 Agent 赋予相同权重。由于这是观察性估算而非对照实验,它衡量的是与 robots.txt 规则的关联性,但不声称 robots.txt 导致每个观察到的差异。Top Blocked Bots 使用 Similarweb 顶级 1000 网站的每日 robots.txt 扫描单独计算。
识别欺骗性 Bot
欺骗统计衡量的是声称代表已知 Agent 但未通过支持的身份验证方法(如已发布 IP 验证或 HTTP 消息签名)的访问流量。每个 Agent 的每日比率针对每个合格网站的服务器总流量计算,然后在网站上取平均值。验证失败表示该访问很可能在冒充所述 Agent;但它无法识别实际发出请求的软件或运营商。不支持身份验证方法的 Agent 不包含在这些测量中。
AI 聊天引用与引荐
AI 聊天引荐统计计算携带已识别 AI 平台作为引荐 URL 或活动来源的人类直接访问次数。没有可用引荐信息的访问无法归因于 AI 平台。引用统计是基于已知为 AI 平台获取内容的 Agent 请求估算的。这些请求表明内容可能为回复提供了信息,但不确认来源是否作为引用向用户显示。由于 AI 平台不提供其来源的完整公开记录,引用结果应作为方向性模式解读,而非精确的引用计数。
常见问题
记者和媒体组织可以使用这些数据吗?
当然可以。您可以注明来源并链接到本页面来引用 The Agentic Web Index。如需采访、事实核查、背景资料或更具体的细分数据用于报道,请联系我们并告知截止日期。
你们与研究人员合作吗?
当然。我们欢迎对 Agent 和 Bot 如何改变网络进行深思熟虑的研究。请告诉我们您的研究问题、时间范围和预期用途。根据范围和数据限制,我们可能能够提供额外背景、比较方法或探索联合分析。
我可以请求特定分析吗?
可以。如果您需要按 Agent、运营商、活动类型、网站分类或时间段细分(此处未显示),请联系我们。当底层数据支持时,我们可以审视问题并提供针对性分析。
如何在我的网站上查看这些趋势?
Agent Analytics 显示哪些 Agent 和 Bot 访问了您的网站、它们访问了什么,以及其活动如何随时间变化。AI Chat Referral Tracking 衡量从 AI 聊天平台到达的人类流量。Automatic Robots.txt 有助于管理哪些 Bot 可以访问您的内容。