跳到正文

AI 爬虫

速览要点

它是什么
代表某个 AI 系统自动抓取页面的程序;这里专门讨论会影响内容在 AI 答案中可见度的三类用途
最关键的区分
三类爬虫的作用不同,放行后对站点的影响甚至相反:训练类把内容用于训练模型权重,检索类支持实时答案并建立答案索引,用户触发类只在单次查询时获取页面
访问规则
是否允许访问应按用途类别决定,不能只按爬虫名称逐个处理,也不能简单地全部放行或全部屏蔽。屏蔽训练类不会影响检索类;屏蔽检索类会让内容立即不再出现在 AI 答案中
代价最高的失误
对所有 AI 爬虫一律设置 Disallow,会在阻止训练的同时失去被引用的机会。「全部封禁」并不是最安全的默认做法,反而代价最高
在答案生成过程中的作用
决定页面能否被检索到,对应答案循环(answer loop)第 2 步,先于可引用性判断。这只是必要条件:页面能被抓取,不代表一定会被系统采信和引用

1. AI 爬虫是什么

AI 爬虫(AI crawler)是代表某个 AI 系统自动抓取页面的程序。真正有意义的分类依据是用途,而不是用户代理。

定义(GEO Wiki 工作定义):这里所说的 AI 爬虫,是代表某个 AI 系统自动抓取页面的程序,专指会影响内容在 AI 答案中可见度的三类用途(训练、检索、用户触发),而不是所有非人类用户代理。

各爬虫的准确 UA 字符串、IP 段和具体屏蔽方法,可查阅 GPTBot、ClaudeBot、PerplexityBot;制定访问策略和分析日志,可参照 AI 爬虫访问审计;爬虫访问页面后能否读取内容,见 SSR for AI Crawlers。

2. 三类用途:最关键的区分

训练 ≠ 检索 ≠ 用户触发,三类程序的用途不同,对站点的影响也截然不同。把它们混为一谈,往往会造成代价最高的错误。

                         ┌──────────────► 训练类爬虫
                         │                 (GPTBot、ClaudeBot、
                         │                  Google-Extended)
                         │                 → 训练或微调模型权重;
                         │                   结果写入模型参数,
                         │                   影响滞后且无法归因
   同一个源页面 ─────────┤
   因三种原因被抓取       │
                         ├──────────────► 检索类爬虫
                         │                 (OAI-SearchBot、
                         │                  PerplexityBot、
                         │                  Claude-SearchBot)
                         │                 → 支持实时答案并
                         │                   建立答案索引;
                         │                   即时、带引用
                         │
                         └──────────────► 用户触发类程序
                                           (ChatGPT-User、
                                            Claude-User、
                                            Perplexity-User)
                                          → 某个用户此刻正
                                            查询你的 URL

是否允许访问,必须按用途类别判断,不能只按爬虫名称逐个处理,也不能简单地全部放行或全部屏蔽。屏蔽训练类不会影响检索类;屏蔽检索类会让内容立即不再出现在 AI 答案中。

在 答案循环 中,这一步决定页面是否具备可检索性,对应第 2 步(进入候选集),发生在 可引用性 判断之前。页面被抓取后,仍需经过系统的采信判断。

3. 三类爬虫对照表

各爬虫条目分别列出了 UA 字符串、IP 核验方法和具体屏蔽规则。爬虫名单变化很快,因此每次复审本表时都要对照官方文档重新核对。

类别抓取目的屏蔽后会失去什么屏蔽后能避免什么代表性爬虫
训练类采集可能用于训练或微调模型权重的内容内容进入未来模型权重、形成「参数记忆」的可能;这类变化通常较晚才会在模型中显现,也无法归因可避免内容进入未来的模型权重GPTBot · ClaudeBot · Google-Extended · CCBot · Applebot-Extended · Amazonbot · Meta-ExternalAgent · Bytespider
检索类为实时答案提供素材,并建立答案引擎索引当前被引用的机会:内容会立即不再出现在 AI 答案中几乎没有额外保护作用:模型训练大多已经发生,或已通过其他语料完成OAI-SearchBot · PerplexityBot · Claude-SearchBot · Googlebot(驱动 AI Overviews,无法单独屏蔽)· Bingbot(驱动 Copilot)
用户触发类用户此刻粘贴或查询了你的 URL该用户针对这一页面的实时查询会在生成答案的过程中失败无法避免任何自动抓取,因为这类程序只在用户操作时获取页面ChatGPT-User · Claude-User · Perplexity-User

屏蔽训练类和检索类爬虫,站点付出的代价并不相同:屏蔽训练类,会失去未来形成参数记忆的机会,但仍能保留被引用的可能;屏蔽检索类,则会失去当前被引用的机会,而模型训练大多已经发生,或已通过其他语料完成。因此,不能因为它们都属于 AI 爬虫就采用同一套规则。

各平台用于实时答案的检索类和用户触发类程序如下:ChatGPT 搜索 使用 OAI-SearchBot 和 ChatGPT-User;Perplexity 使用 PerplexityBot 和 Perplexity-User;Claude 使用 Claude-SearchBot 和 Claude-User;Google AI Overviews 使用 Googlebot(Google-Extended 只决定内容能否用于训练,不决定是否抓取,见 Google’s common crawlers);Bing Copilot 使用 Bingbot。各爬虫条目列出了相应的 UA 字符串和 IP 核验方法。

4. 用户代理字符串由客户端申报,不能证明身份

用户代理字符串由客户端自行申报,而且极易伪造:日志中出现 GPTBot,不代表该请求确实来自 OpenAI。只依据未经核实的 UA 制定策略,既可能误判合法爬虫,也无法拦住冒充合法身份的恶意爬虫。

核验爬虫身份,需要把运营方公布的 IP 段与前向确认反向解析(forward-confirmed rDNS)结合起来。主要运营方都为此提供了机器可读的 IP 列表:OpenAI 为不同爬虫提供 .json IP 文件(见 Overview of OpenAI Crawlers);Anthropic 公布了爬虫 IP 列表(见 Anthropic 爬虫文档);Perplexity 也为各爬虫提供 IP JSON 文件(见 Perplexity Crawlers)。

下面用最简通用示例说明基本原理:

# 前向确认反向解析:原理示例,不针对特定爬虫
1. 对请求 IP 做反向解析            → 主机名
2. 对该主机名做正向解析            → IP
3. 第 2 步的 IP == 请求 IP  且  主机属于运营方域名
   → 身份确认;否则 → 该 UA 视为未经核实

各爬虫条目和 AI 爬虫访问审计 列出了相应的 IP 段、准确的反向解析域名和可运行的核验脚本。另一项正在发展的方案,是用面向自动化流量的 HTTP 消息签名进行密码学身份验证(IETF draft-meunier-web-bot-auth-architecture);这样可以通过签名核验身份,不必依靠 IP 或 UA 推测。该方案目前仍是 Internet-Draft,并非 IETF 正式标准,因此还不能作为现阶段可依赖的访问控制手段,只能作为未来的发展方向。

5. 证据说明:robots.txt 的声明不等于强制执行

robots.txt 依赖爬虫自愿遵守,并非访问控制机制。RFC 9309 明确写道,其中的规则「不是一种访问授权形式」,并且该协议「不能替代有效的内容安全措施」(见 RFC 9309)。

在 robots.txt 中写下 Disallow,并不能保证爬虫真的停止抓取,公开资料已经记录过爬虫不遵守站点禁抓声明的情况。2024 年,多家新闻媒体报道,一家主流答案引擎抓取了明确禁止其爬虫访问的站点(TechCrunch,2024-07-02);2025 年,Cloudflare 发现,某个未声明身份的爬虫伪装成普通浏览器并轮换 IP,在数万个域名上规避禁抓规则(Cloudflare,2025-08-04)。PerplexityBot 条目记录了该爬虫的更多情况。

可以确认的事实应当如何理解
主流第一方爬虫的官方文档明确说明会遵守 robots.txt是否遵守取决于爬虫方的政策,技术上并无保证
robots.txt 可以明确表达站点的访问要求它只能表达要求,无法强制不合规或冒充合法身份的程序遵守这些要求
独立数据记录了规则的采用情况Cloudflare 发现,抽样域名中只有约 14% 的 robots.txt 文件专门设置了 AI 爬虫规则(Cloudflare,2025-07-01);多数站点尚未声明任何策略
可以强制限制访问但这需要在网络层采取措施(WAF、已核验爬虫名单),robots.txt 无法做到

在 robots.txt 中声明访问规则仍有意义,因为合规爬虫会遵守。但这些规则只表达站点的要求,不能强制执行。协议的具体机制见 robots.txt;如何核验实际访问站点的爬虫身份,见 AI 爬虫访问审计。

6. 反模式:屏蔽在什么情况下会适得其反

以下做法表面上都有道理,实际却因为混淆了爬虫类别、技术机制或默认做法而产生相反结果。

反模式为什么看起来对为什么实际会失败
对所有 AI 爬虫一律 Disallow: /可以避免内容被 AI 使用为阻止训练而失去被引用的机会:混淆了爬虫类别,内容会立即不再出现在 AI 答案中,而且这种状态会持续下去。这是最严重的失误
认为屏蔽 GPTBot 就能退出 ChatGPTGPTBot 是 OpenAI 的爬虫ChatGPT 实时答案使用 OAI-SearchBot 和 ChatGPT-User;GPTBot 只负责训练。这里混淆了爬虫用途
把 robots.txt 当作阻止违规爬虫的强制措施站点已经设置 Disallow,爬虫就不能再抓取robots.txt 要求爬虫自愿遵守(§5);冒充合法身份或不合规的程序不会执行这些规则
放行所有爬虫,但页面是纯 CSR访问权限已经开放抓取请求虽然能到达页面,爬虫却读不到正文,因此仍然无法使用页面内容。见 SSR for AI Crawlers
采用固定白名单,从不复查只允许可信的爬虫访问每个季度都会出现新的爬虫,固定白名单会在默认情况下将它们排除

「全部封禁 AI」不是最安全的默认做法,而是代价最高的默认做法。是否屏蔽,需要按用途类别权衡内容保护与被引用的机会,不能作为常规的基础维护措施统一执行。OpenAI 明确表示,内容要出现在 ChatGPT 搜索中并获得引用,前提就是不屏蔽其检索爬虫(见 Publishers and Developers FAQ)。

7. SEO 爬虫与 AI 爬虫:哪些基础不变,哪些做法已经变化

两者共用的抓取基础见 SEO vs GEO。这些基础没有改变,改变的是决定是否允许爬虫访问的方式。

以下要求始终不能放弃:页面可访问、返回 200、不会出现软 404,并保持合理的抓取预算和正确的状态码。Googlebot 一直要求满足这些基础条件,AI 爬虫同样如此。

维度SEO 爬虫时代AI 爬虫时代(变化)
程序数量主要只需关注一个爬虫(Googlebot)需要关注多个爬虫,而且新爬虫还在不断出现
访问规则的含义只需决定是否允许索引要分别决定是否允许训练、检索和用户触发三类用途,且不同决定带来的结果相反
robots.txt既用于声明访问规则,爬虫也会严格遵守这项规范仍可用于声明访问规则,但爬虫的遵守程度较低(§5)
「提交进索引」可以做到(站点地图、ping)只能部分做到,具体方法见 Sitemap 与 IndexNow

问题在于,如果仍沿用 SEO 时代的做法,只设置一套 robots.txt 规则,并默认爬虫都会严格执行,就会忽略 AI 生态中爬虫数量众多、用途分为三类且规则遵守程度较低的现实。

8. AI 爬虫为何影响 GEO,以及该怎么做

页面能被抓取,只说明系统可以把它纳入候选集。这是必要条件,但并不足够。系统随后还要判断是否采信并引用该页面,详见 可引用性。

你的需求参考内容
确认实际访问站点的爬虫身份AI 爬虫访问审计
制定访问规则robots.txt · llms.txt
查询某个爬虫的 UA、IP 和屏蔽方法GPTBot · ClaudeBot · PerplexityBot
确保爬虫能读取所抓取页面的内容SSR for AI Crawlers
了解页面被检索后如何获得引用可引用性
系统地掌握整套方法生成式引擎优化

需要把三件事分开处理:是否屏蔽要按用途类别权衡,身份核验要在网络层完成,页面能否被读取取决于渲染方式。

参考资料

官方爬虫文档(截至 2026-05):

协议与标准:

独立数据与报道:

常见问题

什么是 AI 爬虫?
AI 爬虫是代表某个 AI 系统自动抓取页面的程序。对 GEO 而言,真正需要关注的是会影响内容在 AI 答案中可见度的三类用途(训练、检索、用户触发),而不是所有非人类用户代理。
我该不该屏蔽 AI 爬虫来保护内容?
是否屏蔽必须按用途类别分别判断,不能把统一屏蔽当作一项常规维护。屏蔽训练类(GPTBot、ClaudeBot、Google-Extended)能防止内容进入未来的模型权重,同时保留内容在实时答案中被引用的可能;屏蔽检索类(OAI-SearchBot、PerplexityBot、Claude-SearchBot)则会让内容立即不再出现在 AI 答案中。一律 Disallow 虽能阻止训练,却也会失去即时引用的机会;这不是最安全的默认做法,反而代价最高。
屏蔽了 GPTBot,是不是就退出 ChatGPT 了?
不是,这是把不同用途的爬虫混为一谈。GPTBot 只负责训练。ChatGPT 的实时答案由 OAI-SearchBot(检索索引)和 ChatGPT-User(用户触发取页)提供。屏蔽 GPTBot 只会让内容不进入训练数据,完全不会影响 ChatGPT 搜索中的引用。
robots.txt 真能阻止 AI 爬虫吗?
robots.txt 依赖爬虫自愿遵守,并不具备访问控制能力。RFC 9309 明确说明,其中的规则「不是一种访问授权形式」。主流第一方爬虫的官方文档都表示会遵守这些规则,但是否遵守取决于运营方的政策,技术上并无保证;用户代理字符串又由客户端自行申报,极易伪造。要强制拦截不合规或冒充合法身份的程序,需要在网络层采取措施,robots.txt 做不到。
日志里看到「GPTBot」,就能证明是 OpenAI 抓的吗?
不能。用户代理字符串由客户端自行申报,不能用来确认身份。核验爬虫身份,需要结合运营方公布的 IP 段与前向确认反向解析:OpenAI、Anthropic、Perplexity 都为此公布了 IP 列表。只依据未经核实的 UA 制定策略,既可能误伤身份遭冒用的合法爬虫,也无法拦住冒充合法身份的恶意爬虫。

延伸阅读

参考来源

一手来源

  1. Overview of OpenAI Crawlers (GPTBot / OAI-SearchBot / ChatGPT-User) · OpenAI
  2. Publishers and Developers FAQ — OpenAI Help Center · OpenAI
  3. Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic · 2026-04-07
  4. Perplexity Crawlers (PerplexityBot / Perplexity-User) · Perplexity AI
  5. Overview of Google crawlers and fetchers (user agents) · Google Search Central · 2026-02-09
  6. Google's common crawlers (Google-Extended) · Google Search Central · 2026-04-23
  7. Which crawlers does Bing use? · Microsoft Bing
  8. RFC 9309: Robots Exclusion Protocol · IETF · 2022-09-01

二手来源

  1. Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives · Cloudflare
  2. News outlets are accusing Perplexity of plagiarism and unethical web scraping · TechCrunch
  3. From Googlebot to GPTBot: who's crawling your site in 2025 · Cloudflare
  4. HTTP Message Signatures for automated traffic: Architecture (draft-meunier-web-bot-auth-architecture) · IETF (Internet-Draft)

三手来源[观察]

  1. Anthropic's Claude bots make robots.txt decisions more granular
最近更新: 2026-05-18 作者: Ray Yang 主题: 基础设施