从爬虫可读 HTML 到结构化数据(schema.org/JSON-LD),再到现在 AI 答案引擎的优化策略,涵盖 FAQ 架构和语义标题设计。
我是品牌策略师,不是开发人员——但我跑的每个项目最终都会变成和对方工程团队的对话。过去一年,这种对话发生了变化。以前聊的是 meta 标签和 sitemap,现在聊的是站点是否可以被 AI 回答所使用的模型读取。以下是我实际给开发团队讲解的技术拆解。
这是大多数工程师已经熟悉的领域:可抓取的 HTML、干净的 URL 结构、良好的 Core Web Vitals、准确的 schema.org 标记、准确的 sitemap.xml 和 robots.txt。其核心机制没有太大变化——变化的是结构化数据现在承载的权重变大了,因为 AEO 和 GEO 系统也依赖同一套标记。
这关乎内容的格式化,使其能够被直接提取到精选摘要或语音/聊天回答中。实际操作意味着:在章节开头 1-2 句内给出对隐含问题的直接、自包含回答;真正的 FAQ schema(JSON-LD 中的 FAQPage,而不是仅仅视觉上看起来像手风琴的组件);以及与人们实际提问方式对应的标题结构,而不是仅仅堆砌关键词。如果一个章节脱离上下文单独阅读时无法被正确理解,它就不会被选中。
这是最新的一层,针对的是大型语言模型而不是传统爬虫——比如 AI Overviews、Perplexity、ChatGPT 的浏览模式。我见过真正有效移动指针的几件事:根目录下的 llms.txt 文件(目前仍非正式,不是批准的标准,但越来越受尊重);在每个页面和每个第三方提及中保持关于实体的一致事实声明(NAP 一致性不再只是本地 SEO 的事,它也是实体识别的事);以及直白陈述内容而不是用营销话术埋没重点——生成模型倾向于提取和引用一个区块中最无歧义的句子,所以歧义才是让你被跳过的原因。
三者之间的重叠比大多数团队以为的要大:干净的语义 HTML、结构化数据和无歧义的写作同时为三个系统服务。我最常看到团队过度投入的地方是追逐 GEO 特有的技巧,而他们基本的 schema 标记还是坏的。先把基础打好。
很好奇这里的其他开发者如何处理 llms.txt 和结构化数据以提高 AI 爬虫的可见性——有人现在已经把它作为构建的标准部分,还是仍在实验阶段?