AI搜索更频繁使用site:限定查询而非宽泛搜索,这意味着内容可索引性和信息结构化程度成为新的胜负手,JS渲染页面和PDF内容更难被获取。
ChatGPT 的搜索步骤越来越倾向于发出 site: 作用域的查询,而非宽泛的开放网络搜索。这一细节改变了对任何一个拥有网站、文档或博客的人来说"可被发现"的含义。
site: 作用域搜索的实际含义当模型决定搜索时,它自己来编写查询语句。像 best invoicing tools for freelancers 这样宽泛的查询会从整个索引中拉取结果,模型从中挑选排名靠前的。而像 site:yourdomain.com pricing 这样带作用域的查询,意味着模型已经认定你的域名是正确的来源,现在只需要从中获取某个具体事实。
宽泛搜索奖励的是总体权威性。作用域搜索奖励的是特定答案是否存在于你域名上一个可抓取的页面中——以文本形式、在搜索索引实际见过的 URL 上。如果你的定价信息在一个 JavaScript 渲染的组件里,或者你的 API 速率限制藏在 PDF 中,那么作用域查询会返回空结果——模型要么猜测、要么含糊其辞、要么转向竞争对手的文档页面。
对于使用 RAG(检索增强生成——在查询时向模型提供外部文档)构建系统的 AI 工程师来说,这应该感觉很熟悉。这和未被索引的 chunk 失败模式完全相同。区别在于这个索引不是你的。
你不需要找 GEO 供应商来检查这件事。运行模型会生成的相同作用域查询:
# 当模型已经信任你的域名时会问的问题
site:yourdomain.com pricing
site:yourdomain.com "rate limit"
site:yourdomain.com refund policy
直接将每个查询粘贴到 Google 或 Bing。然后检查答案是否在可见的摘要中——而不是在三层点击深度之后。
然后从终端检查可抓取性:
curl -s https://yourdomain.com/pricing | grep -i "per month"
如果 curl 返回了原始 HTML 但价格不在其中,那说明这个数据是客户端渲染的,对大多数爬虫不可见。对文档页面、FAQ 答案和对比表格做同样的测试。
将字面答案放入服务端渲染的 HTML 中。 价格、限制、版本、日期。
给每个独立的事实分配一个可索引的独立 URL。 一个页面回答"速率限制是什么"要好过一个带锚链接的巨大页面。
使用用户会输入的措辞。 模型从用户语言生成查询,而不是你内部的产品词汇表。
这是不光彩的工作——更像是技术 SEO 规范,而不是提示工程。这也正是大多数团队跳过它的原因。
作用域 site: 查询意味着模型已经选择了你的域名;唯一的问题是那个事实是否可检索。
客户端渲染的事实对爬取步骤来说功能上不可见——curl 加上 grep 几秒钟就能告诉你。
每个可索引 URL 一个清晰的事实,用用户语言撰写,效果胜过把它埋没在一个综合页面里。
现在立刻为你自己的网站运行一个作用域查询——哪个你以为是公开的具体事实返回了空结果?
参考来源:Simon Willison 的博客、Promptwatch 报道