给开发者的 GEO 落地指南:从部署 llms.txt 开始
第一步:llms.txt——给 AI 的自我介绍
llms.txt 是放在网站根目录的纯文本文件,作用是给抓取方一份标准化的「自我介绍」:品牌是谁、做什么、官网在哪、核心页面有哪些。它不替代页面内容,但能大幅降低 AI 理解站点的成本。
- 放在网站根目录,保持纯文本、UTF-8 编码
- 不依赖 JS 渲染,任何爬虫都能直接读到
- 内容包括品牌名、一句话定位、关于信息与核心页面链接
第二步:结构化数据——让 AI 解析出实体
结构化数据用机器可读的方式告诉模型页面的实体与关系。对 GEO 而言,最常见的三类标注是 Organization、FAQPage 与 Product/Service。
- Organization:品牌名称、官网、描述与主体信息
- FAQPage:「问题-答案」配对,利于语义召回与直接摘录
- Product/Service:明确你提供什么
第三步:爬虫适配——别把 AI 挡在门外
在内容优化之前,先确认 AI 爬虫能访问页面。常见问题包括 robots.txt 把搜索引用类爬虫整站拦截、核心内容只存在于浏览器渲染之后、sitemap 缺失或无法访问。
- 检查 robots.txt,不要误拦 GPTBot、ClaudeBot、PerplexityBot 等搜索引用类爬虫
- 核心内容尽量 SSR 或预渲染,保证初始 HTML 可见
- 维护干净、可访问的 XML sitemap,并正确声明路径
第四步:内容结构——让 AI 读得懂
页面结构越清晰,越容易被语义匹配。推荐的写法是「H1 主题 + H2 分节 + FAQ 直接回答」:H1 说明页面回答什么,H2 把答案拆成可摘录的小节,FAQ 用问题-答案对覆盖常见追问。
第五步:性能与可访问性
页面性能对 AI 抓取同样重要。首屏内容应尽快可见,减少阻塞资源,保证 HTTPS 正常。抓取超时或页面反复失败,会直接降低内容被纳入候选池的概率。
落地之后:怎么验证效果
部署完成后,定期用品牌词和行业词在主要 AI 引擎提问,记录模型是否提到、引用或认错品牌。早期可以手动固定提示词、平台与频率,用表格跟踪变化;是否引入自动化工具,应以实际采样规模和数据条件为前提。
常见问题
llms.txt 会泄露不该公开的信息吗?
它和普通页面一样属于公开内容,只放希望被公开了解的品牌信息与核心页面链接即可,不需要包含任何非公开资料。
部署后多久能看到变化?
取决于抓取与索引周期,没有固定时间。持续监测并保持结构稳定,比一次性部署更重要。