Trellner 报告揭露三个网站生成了超过 21.5 万个「最佳软件」SEO 页面,AI 搜索工具 Perplexity 将其作为权威来源引用,暴露 AI 搜索引擎被低成本内容农场污染的问题。
我们向两个基于 Web 检索的模型询问了 380 个软件类别中的最佳产品,并保留了它们检索到的每一个 URL。在返回的 7,534 条引用中,59.8% 指向在 Tranco top-1M 列表中排名低于第 10 万位的域名,23.4% 指向根本不在前 100 万之内的域名。其中两个用于 grounding 的站点将首页的 HTML 标题设为"Facts & Grounding Page"——grounding 即这些模型执行的检索步骤——它们与第三个显然受同一控制的公司共同发布了 215,128 个机器生成的"最佳 <类别>"页面;这三个域名在 2023 年 12 月之前均不存在。
2026 年 9 月 2 日,我们通过 OpenRouter 向 perplexity/sonar 和 perplexity/sonar-pro 输入了 380 个购买意图类别——从"CRM 软件"到"博物馆藏品管理软件"——每个模型每个类别一条提示,共 760 次调用。每次调用都要求返回 JSON 格式的前五名排名,包含每个产品的官方首页域名。760 次调用全部返回了可解析的答案,且两个模型都报告了它们检索到的 URL,这正是它们被选中的原因。这些类别在看到任何结果之前就已拟定,且从未修改。
由此产生了 3,800 个推荐位,共涉及 1,807 个不同产品,以及覆盖 2,055 个不同域名的 7,534 条引用。随后我们在 2026-09-01 的 Tranco 每日列表和 Wayback Machine 中查找了每个被引用的域名,并获取了模型提供的 1,502 个 vendor 首页,以查看它们是否仍然存在。
Google 未被纳入测试。在 OpenRouter 上对 Gemini 模型进行 grounding 意味着通过 OpenRouter 自己的网络搜索插件路由,因此引用描述的将是该插件而非 Google 的检索行为。只有 Perplexity 被测量,任何其他搜索引擎的结论都不应从本文得出。
在指向有排名域名的 5,768 条引用中,Tranco 排名的中位数是 71,611。集中于头部并不奇怪——被引用最多的十个域名占据了 17.3% 的引用——因此故事并非一群知名网站垄断了答案。真正的问题在于另外五分之四的部分:2,055 个被引用域名中有 751 个(占 36.5%)不在前 100 万之内。
这些域名的历史也更新。被引用但无排名域名的 Wayback 首次抓取年份中位数是 2020 年,而有排名的是 2011 年;在 2025 年或之后首次被抓取的归档无排名域名占 16.6%,而有排名的仅占 1.6%。
十大被引用域名:
作为对比,Wikipedia 在 7,534 条引用中仅被提及 3 次。
第三大来源是一个 vendor 的营销博客
guideflow.com 销售交互式产品演示。它不是评论网站、目录或出版商,也不参与我们询问的任何类别。然而它的博客在我们的 380 个类别中被引用了 194 次,覆盖其中 96 个——总体排名第三,超过了 Gartner。每条引用都是不同的 URL:96 个不同的 guideflow.com 博客 URL,每个类别一个,其中六个是同一篇文章的爱沙尼亚语副本。它的站点地图列出了 3,351 个博客 URL,其中 2,176 个是独立文章。它为"3D 渲染软件"、"IVR 软件"、"RFID 软件"和"建筑实践软件"等不同类别提供了 grounding。
这一切都不存在欺骗。Guideflow 和成千上万家公司一样,发布大量内容营销博客。问题在于检索层如何处理它:一家 vendor 自己发布的、关于其并未涉足市场的列表文章,成了关于"购买哪款产品"这一问题的第三大证据来源。
十大及十大附近的另外三个站点是 wifitalents.com(71 次引用,27 个类别)、worldmetrics.org(60 次,22 个)和 gitnux.org(50 次,23 个)。它们共占 181 条引用,占总量的 2.4%,出现在 380 个类别中的 41 个里。
它们似乎是同一套运营。三个站点都在 2023 年 12 月至 2024 年 5 月间通过 NameCheap 注册,都将 DNS 委托给同一对 Cloudflare 域名服务器 pam.ns.cloudflare.com 和 sean.ns.cloudflare.com,且都运行相同的页面模板和导航——Services、Market Data、Software Advice、Editorial Process、Company。每个站点也维护一个恰好六篇文章的博客,且全部 18 篇都是关于该站点组合中其他品牌的:各两篇分别介绍另外两个品牌,两篇介绍第四个品牌 zipdo.co,该品牌使用同一对域名服务器,并将其首页标题同样设为"Facts & Grounding Page"。共用域名服务器对是同一 Cloudflare 账号的有力间接证据,而非所有权证明,但模板、分类体系和博客内容逐项匹配。
它们的规模才是重点。它们的站点地图分别列出了 103,578、107,083 和 105,541 个 URL,其中 70,731、71,684 和 72,713 个是 /best/<something>-software/ 页面:三个品牌共生成 215,128 个购买指南,而每个品牌仅有六篇博客(每个站点地图的第七个 /blog/ URL 是博客索引)。软件类别并没有 215,128 个。
自我描述才是使它们不同寻常之处。2026 年 9 月 2 日获取时,worldmetrics.org 和 gitnux.org 都返回形如"<Brand> — Facts & Grounding Page"的 HTML 标题,以及除了品牌名外完全相同的 meta 描述:
Verified facts about Gitnux: an independent market research company publishing industry statistics, custom research, and software Best Lists. Company, legal, methodology, and compliance details in one machine-readable record.
Grounding 不是买家使用的术语。这是检索系统获取文档以约束答案的那个步骤的名称。关于自己的机器可读验证事实记录也不是对人类读者的服务。这些页面的标题和描述是写给读取它们的软件看的。
这种读取也通过常规途径被购买。worldmetrics.org 广告"起价 €5,000"的定制市场研究、"起价 €499"的现成报告和"起价 €2,500"的 vendor 筛选服务,标价格式与模型检索到的那些生成的 Best Lists 分类体系相同。
我们从三个品牌获取了同一个类别页面:"project estimation software"。每个页面都在 JSON-LD 中声明了它们的排名,因此无需解读即可读取。每个页面列出十款工具;前五名如下展示。
Gitnux 的优胜者根本不出现在 Worldmetrics 的前五名中。每个页面标注了三位具名员工——Worldmetrics 归功于 Kathryn Blake、Alexander Schmidt 和 Victoria Marsh;Gitnux 归功于 Diana Reeves、Helena Kowalczyk 和 Olivia Thornton;WifiTalents 归功于 Ryan Gallagher、Isabella Rossi 和 Natasha Ivanova——同一个问题九个不同的人。每个页面都声明了一套编辑流程;Gitnux 将其结果标注为"AI-verified · Expert reviewed"。三个都有一段未渲染的模板变量出现在署名行中,其中两个显示"Within the next 26 days",另一个显示"Within the next 40 days"。
模型提供的 1,502 个 vendor 首页大部分正常。我们对每个检查了两次,一次直接访问,一次通过轮换代理,如果任一尝试能访问到就算该站点可达,这样屏蔽了我们某个 IP 的主机不会被记录为死亡公司。
1,502 个中有 10 个完全无法解析地址——其中八个未委托给任何域名服务器——包括 graphiql.com(被提供为 GraphiQL 的官网,但该站点不存在)、todo.com(被提供为 Microsoft To Do)和 aquasecurity.io(被提供为 Trivy)。另外四个能解析但从不响应。加上 404 的,共有 17 个域名(1.1%)已消失或不可达。另有 92 个(6.1%)重定向到另一个可注册域名;其中大部分是寻常的收购和品牌更名,我们发布了完整列表而非逐一猜测。
有两个不是寻常收购,且两个层级给出了不同结论。在被问及研究数据管理平台时,两个都提到了 Dryad:sonar-pro 给出了真实仓库 datadryad.org,sonar 给出了 dryad.co,该域名重定向到一个印度尼西亚在线赌博门户,标题以"BIGSLOT288 | Portal Game Online"开头。在被问及数据质量工具时,两个都提到了 Monte Carlo:sonar 给出了 montecarlodata.com,sonar-pro 给出了 montecarlo.com,该域名重定向到蒙特卡洛海滨浴场集团(Monte-Carlo Société des Bains de Mer),即摩纳哥的酒店和赌场集团。
这两个模型并非两个独立测量。在 380 个类别中,它们返回了 289 次完全一致的引用列表,URL 集合的 Jaccard 重叠度为 0.898,因此 Perplexity 各层级共享一个检索层,应被视为一次搜索栈的两次采样。它们在第一名上的共识——290 个类别中同一产品排第一——是关于那个共享检索层的事实,而非独立系统趋同的证据。
结果仅覆盖 Perplexity。我们尚未测量 ChatGPT、Gemini、Copilot 或 Google 的 AI Mode,没有理由假设它们的检索组合相同。
380 个类别是我们自己的构建,而非买家实际提问的样本,面向小众垂直领域的列表比通用查询列表会暴露更多长尾来源。
每次页面获取都通过一个具名研究用户代理的轮换数据中心代理发出,因此这些站点返回给我们的不一定就是它们返回给检索爬虫或浏览器的。
17 个不可达 vendor 域名中有四个是大型站点,nasdaq.com 和 solidworks.com 等,它们明显存活良好,只是从未响应自动化请求;它们被计为不可达,而非死亡。整个运行是某一天检索索引的快照,该索引会变化。
一种提示措辞,每个类别一次运行,无重复采样。早期的试点研究表明,当"best"替换为"most popular"时,产品短名单变化明显,而引用组合变化不大,但本次运行未测量这一点。
Tranco 排名是受欢迎程度指标,而非质量指标,低排名不是指控。它在这里仅用于区分广受访问的网络与其他一切;关于任何具体站点的每项声明都基于该站点自己的页面,这些页面在数据集中有链接和归档。
我们尚未展示这一切是否改变了答案。我们没有测试移除这些来源是否会产生不同的推荐,Guideflow 和三个 Best List 品牌很可能推荐了合理的产品。我们测量的是证据基础由哪些文档组成。
最后,三个品牌的共同控制权是从共享基础设施和相同模板推断的。我们不知道谁在运营它们;三者均未指名所有者。
完整数据集——每条引用、每条推荐、Tranco 和 Wayback 查询、vendor 可用性检查——以及产生上述所有数字的脚本均位于 /data/manufactured-sources-behind-ai-recommendations/,方法和列文档也在同一位置。基于 CC BY 4.0 发布。本报告的 PDF 版本见 trellner.com/data/manufactured-sources-behind-ai-recommendations/manufactured-sources-behind-ai-recommendations.pdf。