AI 搜索比传统搜索多经历 retrieve→synthesize→cite 三个阶段,内容可被语义相似度而非关键词匹配检索到,理解这个机制才能做有效的 AI SEO。
如果你这辈子一直在针对 Google 爬虫做优化,那么 AI 搜索引擎乍一看会感觉很熟悉——然后完全不同。以下是 AI 搜索实际如何解析、理解并决定引用某个网站的技术拆解,以及这对我们今后如何构建和结构化内容意味着什么。
传统搜索有一条核心流水线:爬取 → 索引 → 排名。AI 搜索增加了一个关键额外阶段:检索 → 合成 → 引用。
Crawl/Index — 与以往相同。如果一个页面不可爬取(robots.txt 问题、纯前端渲染无服务端降级、内链断裂),AI 搜索中它同样不存在。
Retrieval — 当用户提出问题时,AI 系统(通过 RAG — retrieval-augmented generation — 或实时搜索插件)拉取一组看似相关的候选文档/页面,使用的是 embeddings 和语义相似度,而非仅关键词匹配。
Synthesis — 模型读取检索到的内容并生成全新答案,融合多个来源的信息。
Citation — 一些系统(Perplexity、Google AI Overviews、Bing Copilot)附加来源链接;另一些(部分 ChatGPT 模式)合成内容时不显示归属,但底层内容仍然塑造了答案。
关键的技术转变:你不再是在针对排名算法做优化——而是在针对检索 + 推理系统做优化。
AI 检索严重依赖向量 embeddings——内容被转换为高维语义表示,而非文本字符串。这有实际的 implication:
Keyword stuffing does nothing. Embeddings 捕获语义含义,因此同义词、相关概念和自然表达方式比精确匹配的重复更重要。
Clear heading hierarchy (H1 → H2 → H3) helps chunking. 大多数 RAG 流水线在嵌入前将页面分割成 chunks。结构良好的标题产生更清晰、更连贯的 chunks——从而有更好的检索效果。
Self-contained sections retrieve better than sprawling narrative. 如果一个 chunk 需要前面三段上下文才能理解,那么它单独检索时效果就很差。
Schema.org 标记(Article、FAQPage、HowTo、Organization、LocalBusiness)为 AI 系统提供关于页面是什么及其声明什么的显式、机器可读信号——减少纯粹依赖 NLP 解释的歧义。在 AI 搜索时代这一点并未消失;如果有的话,结构良好的标记是一种低成本、高信号的方式,帮助模型正确解析页面。
Google 的 E-E-A-T 框架(Experience、Expertise、Authoritativeness、Trustworthiness)不再只是人类排名指南——AI 模型通过计算方式近似这些信号:
Author entity resolution — 作者在网络上是否有一致、可验证的身份(关联的个人资料、其他发表作品、其他地方的提及)?
Citation graph — 这个域名/页面被其他独立来源引用的频率如何?这与分析反向链接类似,但偏向编辑性提及而非链接农场模式。
Content freshness and consistency — 相同的事实声明是否在多个独立来源中一致出现,还是孤立的异常声明?
如果你在构建或维护一个考虑 AI 可见性的网站:
GEO 不是附加在 SEO 上的替代学科——它是 SEO 的基础(可爬取性、结构、可信度)应用于检索和推理系统而非排名算法。理解这条流水线——爬取、检索、合成、引用——是推理什么有效什么无效的最快方式。
I write more about the intersection of SEO, GEO, and digital marketing strategy at thenasim.com — feel free to check it out.