技术指南
AI 搜索爬虫适配指南:robots.txt、结构化数据与可抓取性
2026-07-28抵岸纪内容团队6 分钟
robots.txt:别误拦 AI 爬虫
robots.txt 是抓取的第一道门。很多站点为了防训练类爬虫,把入口整段 Disallow,结果把搜索引用类爬虫也挡在了外面。两类爬虫的诉求不同,应当区分对待。
- 不要对搜索引用类爬虫整站 Disallow
- 允许 /blog/、/product/ 等内容页被抓取
- 声明 sitemap.xml 并确保路径可访问
- 不要用 noindex 拦截内容主页
结构化数据:让 AI 读懂页面
结构化数据把页面的实体与关系明确标注出来,减少模型「猜」的成本。对 GEO 最常用的是三件套。
- Organization Schema:品牌实体标注,包含名称、URL、描述等
- FAQPage Schema:「问题-答案」配对,利于语义召回
- Article Schema:作者、发布时间、发布者等可验证性信号
页面可抓取性:逐项检查
即使 robots 与结构化数据都正确,页面自身的可抓取性也会决定结果。下面是最常见的五类问题与对应修复。
- 依赖 JS 渲染 → 使用 SSR 或预渲染,保证初始 HTML 有正文
- 页面加载慢 → CDN、图片懒加载、资源压缩
- 无内链入口 → 每个内容页至少有一条内链
- 重复内容 → 部署 canonical 标签
- 无移动端适配 → 使用响应式或独立移动端页面
从 0 到 1 的部署清单
按顺序执行一遍,即可完成基础的抓取适配。
- 检查并修正 robots.txt
- 部署 llms.txt
- 部署 JSON-LD 结构化数据
- SSR 或预渲染核心内容
- 部署 canonical 标签
- 提交并验证 sitemap
- 补齐页面内链
怎么验证适配效果
适配完成后,用品牌词与行业词在主要 AI 引擎提问,观察回答是否引用你的页面。系统化做法是固定提示词与平台,定期记录引用来源,跟踪引用率变化。
常见问题
防 AI 训练爬虫和允许搜索爬虫冲突吗?
不冲突。robots.txt 可以按 User-agent 分别设置:拒绝训练类爬虫抓取用于训练,同时放行搜索引用类爬虫用于检索。
预渲染和 SSR 必须二选一吗?
目标都是「核心内容在初始 HTML 中可见」。SSR、静态预渲染或同构渲染都能达成,选择取决于站点技术栈。