抵岸纪抵岸纪
技术指南

AI 搜索爬虫适配指南:robots.txt、结构化数据与可抓取性

2026-07-28抵岸纪内容团队6 分钟

robots.txt:别误拦 AI 爬虫

robots.txt 是抓取的第一道门。很多站点为了防训练类爬虫,把入口整段 Disallow,结果把搜索引用类爬虫也挡在了外面。两类爬虫的诉求不同,应当区分对待。

  • 不要对搜索引用类爬虫整站 Disallow
  • 允许 /blog/、/product/ 等内容页被抓取
  • 声明 sitemap.xml 并确保路径可访问
  • 不要用 noindex 拦截内容主页

结构化数据:让 AI 读懂页面

结构化数据把页面的实体与关系明确标注出来,减少模型「猜」的成本。对 GEO 最常用的是三件套。

  • Organization Schema:品牌实体标注,包含名称、URL、描述等
  • FAQPage Schema:「问题-答案」配对,利于语义召回
  • Article Schema:作者、发布时间、发布者等可验证性信号

页面可抓取性:逐项检查

即使 robots 与结构化数据都正确,页面自身的可抓取性也会决定结果。下面是最常见的五类问题与对应修复。

  • 依赖 JS 渲染 → 使用 SSR 或预渲染,保证初始 HTML 有正文
  • 页面加载慢 → CDN、图片懒加载、资源压缩
  • 无内链入口 → 每个内容页至少有一条内链
  • 重复内容 → 部署 canonical 标签
  • 无移动端适配 → 使用响应式或独立移动端页面

从 0 到 1 的部署清单

按顺序执行一遍,即可完成基础的抓取适配。

  • 检查并修正 robots.txt
  • 部署 llms.txt
  • 部署 JSON-LD 结构化数据
  • SSR 或预渲染核心内容
  • 部署 canonical 标签
  • 提交并验证 sitemap
  • 补齐页面内链

怎么验证适配效果

适配完成后,用品牌词与行业词在主要 AI 引擎提问,观察回答是否引用你的页面。系统化做法是固定提示词与平台,定期记录引用来源,跟踪引用率变化。

常见问题

防 AI 训练爬虫和允许搜索爬虫冲突吗?

不冲突。robots.txt 可以按 User-agent 分别设置:拒绝训练类爬虫抓取用于训练,同时放行搜索引用类爬虫用于检索。

预渲染和 SSR 必须二选一吗?

目标都是「核心内容在初始 HTML 中可见」。SSR、静态预渲染或同构渲染都能达成,选择取决于站点技术栈。

参考来源