跳到正文

技术 GEO

审计爬虫访问、渲染、结构化数据与内容发现机制。

适合
负责站点基础设施、平台工程或技术 SEO 的工程师。
开始前需要
GEO 入门第 1 步(定义)
完成后可以
能从访问到渲染,完整审计并改进站点面向 AI 爬虫的交付链路。
从第 1 步开始 →
  1. AI 爬虫的三类用途

    设置访问规则前,先按模型训练、搜索检索和用户触发抓取区分 AI 爬虫,因为三类用途需要不同的判断标准。

    预计耗时:12 分钟

  2. 主要 AI 爬虫:GPTBot、ClaudeBot 与 PerplexityBot

    比较 GPTBot、ClaudeBot 与 PerplexityBot 的用户代理标识、公开用途、实际行为和停用机制,并根据日志确定检查顺序。

    预计耗时:12 分钟

  3. robots.txt 与访问控制

    修改爬虫策略前,先了解 robots.txt 如何按用户代理划分规则、处理路径冲突,以及它与强制访问控制有何区别。

    预计耗时:12 分钟

  4. llms.txt

    应把 llms.txt 视为仍在发展的内容导航约定,而非访问控制文件或已证实的引用信号,并在部署前核对现有证据。

    预计耗时:12 分钟

  5. Schema.org 与 JSON-LD

    使用 Schema.org 明确描述实体及其关系,同时将这一作用与排名或引用主张区分开,并比较不同的序列化方式。

    预计耗时:15 分钟

  6. 渲染方式:SSR 与 CSR 对 AI 爬虫的影响

    在 SSR、SSG、CSR 或边缘渲染之间选择前,应先检查各类爬虫实际收到的 HTML;网页核心指标则是另一项因平台而异的问题。

    预计耗时:12 分钟

  7. Sitemap 与 IndexNow

    Sitemap 与 IndexNow 对部分 AI 产品的影响来自其依赖的搜索索引,而非直接接入。应先厘清依赖关系,再决定提交方式。

    预计耗时:12 分钟

  8. 站点 AI 爬虫访问审计

    将前述判断应用于自己的域名,按依赖关系整理审计发现,优先处理访问和渲染问题,再安排后续改进。

    预计耗时:30 分钟