技术 GEO
审计爬虫访问、渲染、结构化数据与内容发现机制。
- 适合
- 负责站点基础设施、平台工程或技术 SEO 的工程师。
- 开始前需要
- GEO 入门第 1 步(定义)
- 完成后可以
- 能从访问到渲染,完整审计并改进站点面向 AI 爬虫的交付链路。
- AI 爬虫的三类用途
设置访问规则前,先按模型训练、搜索检索和用户触发抓取区分 AI 爬虫,因为三类用途需要不同的判断标准。
预计耗时:12 分钟
- 主要 AI 爬虫:GPTBot、ClaudeBot 与 PerplexityBot
比较 GPTBot、ClaudeBot 与 PerplexityBot 的用户代理标识、公开用途、实际行为和停用机制,并根据日志确定检查顺序。
预计耗时:12 分钟
- robots.txt 与访问控制
修改爬虫策略前,先了解 robots.txt 如何按用户代理划分规则、处理路径冲突,以及它与强制访问控制有何区别。
预计耗时:12 分钟
- llms.txt
应把 llms.txt 视为仍在发展的内容导航约定,而非访问控制文件或已证实的引用信号,并在部署前核对现有证据。
预计耗时:12 分钟
- Schema.org 与 JSON-LD
使用 Schema.org 明确描述实体及其关系,同时将这一作用与排名或引用主张区分开,并比较不同的序列化方式。
预计耗时:15 分钟
- 渲染方式:SSR 与 CSR 对 AI 爬虫的影响
在 SSR、SSG、CSR 或边缘渲染之间选择前,应先检查各类爬虫实际收到的 HTML;网页核心指标则是另一项因平台而异的问题。
预计耗时:12 分钟
- Sitemap 与 IndexNow
Sitemap 与 IndexNow 对部分 AI 产品的影响来自其依赖的搜索索引,而非直接接入。应先厘清依赖关系,再决定提交方式。
预计耗时:12 分钟
- 站点 AI 爬虫访问审计
将前述判断应用于自己的域名,按依赖关系整理审计发现,优先处理访问和渲染问题,再安排后续改进。
预计耗时:30 分钟