AI 爬虫
速览要点
- 它是什么
- 代表某个 AI 系统自动抓取页面的程序;这里专门讨论会影响内容在 AI 答案中可见度的三类用途
- 最关键的区分
- 三类爬虫的作用不同,放行后对站点的影响甚至相反:训练类把内容用于训练模型权重,检索类支持实时答案并建立答案索引,用户触发类只在单次查询时获取页面
- 访问规则
- 是否允许访问应按用途类别决定,不能只按爬虫名称逐个处理,也不能简单地全部放行或全部屏蔽。屏蔽训练类不会影响检索类;屏蔽检索类会让内容立即不再出现在 AI 答案中
- 代价最高的失误
- 对所有 AI 爬虫一律设置 Disallow,会在阻止训练的同时失去被引用的机会。「全部封禁」并不是最安全的默认做法,反而代价最高
- 在答案生成过程中的作用
- 决定页面能否被检索到,对应答案循环(answer loop)第 2 步,先于可引用性判断。这只是必要条件:页面能被抓取,不代表一定会被系统采信和引用
1. AI 爬虫是什么
AI 爬虫(AI crawler)是代表某个 AI 系统自动抓取页面的程序。真正有意义的分类依据是用途,而不是用户代理。
定义(GEO Wiki 工作定义):这里所说的 AI 爬虫,是代表某个 AI 系统自动抓取页面的程序,专指会影响内容在 AI 答案中可见度的三类用途(训练、检索、用户触发),而不是所有非人类用户代理。
各爬虫的准确 UA 字符串、IP 段和具体屏蔽方法,可查阅 GPTBot、ClaudeBot、PerplexityBot;制定访问策略和分析日志,可参照 AI 爬虫访问审计;爬虫访问页面后能否读取内容,见 SSR for AI Crawlers。
2. 三类用途:最关键的区分
训练 ≠ 检索 ≠ 用户触发,三类程序的用途不同,对站点的影响也截然不同。把它们混为一谈,往往会造成代价最高的错误。
┌──────────────► 训练类爬虫
│ (GPTBot、ClaudeBot、
│ Google-Extended)
│ → 训练或微调模型权重;
│ 结果写入模型参数,
│ 影响滞后且无法归因
同一个源页面 ─────────┤
因三种原因被抓取 │
├──────────────► 检索类爬虫
│ (OAI-SearchBot、
│ PerplexityBot、
│ Claude-SearchBot)
│ → 支持实时答案并
│ 建立答案索引;
│ 即时、带引用
│
└──────────────► 用户触发类程序
(ChatGPT-User、
Claude-User、
Perplexity-User)
→ 某个用户此刻正
查询你的 URL
是否允许访问,必须按用途类别判断,不能只按爬虫名称逐个处理,也不能简单地全部放行或全部屏蔽。屏蔽训练类不会影响检索类;屏蔽检索类会让内容立即不再出现在 AI 答案中。
在 答案循环 中,这一步决定页面是否具备可检索性,对应第 2 步(进入候选集),发生在 可引用性 判断之前。页面被抓取后,仍需经过系统的采信判断。
3. 三类爬虫对照表
各爬虫条目分别列出了 UA 字符串、IP 核验方法和具体屏蔽规则。爬虫名单变化很快,因此每次复审本表时都要对照官方文档重新核对。
| 类别 | 抓取目的 | 屏蔽后会失去什么 | 屏蔽后能避免什么 | 代表性爬虫 |
|---|---|---|---|---|
| 训练类 | 采集可能用于训练或微调模型权重的内容 | 内容进入未来模型权重、形成「参数记忆」的可能;这类变化通常较晚才会在模型中显现,也无法归因 | 可避免内容进入未来的模型权重 | GPTBot · ClaudeBot · Google-Extended · CCBot · Applebot-Extended · Amazonbot · Meta-ExternalAgent · Bytespider |
| 检索类 | 为实时答案提供素材,并建立答案引擎索引 | 当前被引用的机会:内容会立即不再出现在 AI 答案中 | 几乎没有额外保护作用:模型训练大多已经发生,或已通过其他语料完成 | OAI-SearchBot · PerplexityBot · Claude-SearchBot · Googlebot(驱动 AI Overviews,无法单独屏蔽)· Bingbot(驱动 Copilot) |
| 用户触发类 | 用户此刻粘贴或查询了你的 URL | 该用户针对这一页面的实时查询会在生成答案的过程中失败 | 无法避免任何自动抓取,因为这类程序只在用户操作时获取页面 | ChatGPT-User · Claude-User · Perplexity-User |
屏蔽训练类和检索类爬虫,站点付出的代价并不相同:屏蔽训练类,会失去未来形成参数记忆的机会,但仍能保留被引用的可能;屏蔽检索类,则会失去当前被引用的机会,而模型训练大多已经发生,或已通过其他语料完成。因此,不能因为它们都属于 AI 爬虫就采用同一套规则。
各平台用于实时答案的检索类和用户触发类程序如下:ChatGPT 搜索 使用 OAI-SearchBot 和 ChatGPT-User;Perplexity 使用 PerplexityBot 和 Perplexity-User;Claude 使用 Claude-SearchBot 和 Claude-User;Google AI Overviews 使用 Googlebot(Google-Extended 只决定内容能否用于训练,不决定是否抓取,见 Google’s common crawlers);Bing Copilot 使用 Bingbot。各爬虫条目列出了相应的 UA 字符串和 IP 核验方法。
4. 用户代理字符串由客户端申报,不能证明身份
用户代理字符串由客户端自行申报,而且极易伪造:日志中出现 GPTBot,不代表该请求确实来自 OpenAI。只依据未经核实的 UA 制定策略,既可能误判合法爬虫,也无法拦住冒充合法身份的恶意爬虫。
核验爬虫身份,需要把运营方公布的 IP 段与前向确认反向解析(forward-confirmed rDNS)结合起来。主要运营方都为此提供了机器可读的 IP 列表:OpenAI 为不同爬虫提供 .json IP 文件(见 Overview of OpenAI Crawlers);Anthropic 公布了爬虫 IP 列表(见 Anthropic 爬虫文档);Perplexity 也为各爬虫提供 IP JSON 文件(见 Perplexity Crawlers)。
下面用最简通用示例说明基本原理:
# 前向确认反向解析:原理示例,不针对特定爬虫
1. 对请求 IP 做反向解析 → 主机名
2. 对该主机名做正向解析 → IP
3. 第 2 步的 IP == 请求 IP 且 主机属于运营方域名
→ 身份确认;否则 → 该 UA 视为未经核实
各爬虫条目和 AI 爬虫访问审计 列出了相应的 IP 段、准确的反向解析域名和可运行的核验脚本。另一项正在发展的方案,是用面向自动化流量的 HTTP 消息签名进行密码学身份验证(IETF draft-meunier-web-bot-auth-architecture);这样可以通过签名核验身份,不必依靠 IP 或 UA 推测。该方案目前仍是 Internet-Draft,并非 IETF 正式标准,因此还不能作为现阶段可依赖的访问控制手段,只能作为未来的发展方向。
5. 证据说明:robots.txt 的声明不等于强制执行
robots.txt 依赖爬虫自愿遵守,并非访问控制机制。RFC 9309 明确写道,其中的规则「不是一种访问授权形式」,并且该协议「不能替代有效的内容安全措施」(见 RFC 9309)。
在 robots.txt 中写下 Disallow,并不能保证爬虫真的停止抓取,公开资料已经记录过爬虫不遵守站点禁抓声明的情况。2024 年,多家新闻媒体报道,一家主流答案引擎抓取了明确禁止其爬虫访问的站点(TechCrunch,2024-07-02);2025 年,Cloudflare 发现,某个未声明身份的爬虫伪装成普通浏览器并轮换 IP,在数万个域名上规避禁抓规则(Cloudflare,2025-08-04)。PerplexityBot 条目记录了该爬虫的更多情况。
| 可以确认的事实 | 应当如何理解 |
|---|---|
| 主流第一方爬虫的官方文档明确说明会遵守 robots.txt | 是否遵守取决于爬虫方的政策,技术上并无保证 |
| robots.txt 可以明确表达站点的访问要求 | 它只能表达要求,无法强制不合规或冒充合法身份的程序遵守这些要求 |
| 独立数据记录了规则的采用情况 | Cloudflare 发现,抽样域名中只有约 14% 的 robots.txt 文件专门设置了 AI 爬虫规则(Cloudflare,2025-07-01);多数站点尚未声明任何策略 |
| 可以强制限制访问 | 但这需要在网络层采取措施(WAF、已核验爬虫名单),robots.txt 无法做到 |
在 robots.txt 中声明访问规则仍有意义,因为合规爬虫会遵守。但这些规则只表达站点的要求,不能强制执行。协议的具体机制见 robots.txt;如何核验实际访问站点的爬虫身份,见 AI 爬虫访问审计。
6. 反模式:屏蔽在什么情况下会适得其反
以下做法表面上都有道理,实际却因为混淆了爬虫类别、技术机制或默认做法而产生相反结果。
| 反模式 | 为什么看起来对 | 为什么实际会失败 |
|---|---|---|
对所有 AI 爬虫一律 Disallow: / | 可以避免内容被 AI 使用 | 为阻止训练而失去被引用的机会:混淆了爬虫类别,内容会立即不再出现在 AI 答案中,而且这种状态会持续下去。这是最严重的失误 |
| 认为屏蔽 GPTBot 就能退出 ChatGPT | GPTBot 是 OpenAI 的爬虫 | ChatGPT 实时答案使用 OAI-SearchBot 和 ChatGPT-User;GPTBot 只负责训练。这里混淆了爬虫用途 |
| 把 robots.txt 当作阻止违规爬虫的强制措施 | 站点已经设置 Disallow,爬虫就不能再抓取 | robots.txt 要求爬虫自愿遵守(§5);冒充合法身份或不合规的程序不会执行这些规则 |
| 放行所有爬虫,但页面是纯 CSR | 访问权限已经开放 | 抓取请求虽然能到达页面,爬虫却读不到正文,因此仍然无法使用页面内容。见 SSR for AI Crawlers |
| 采用固定白名单,从不复查 | 只允许可信的爬虫访问 | 每个季度都会出现新的爬虫,固定白名单会在默认情况下将它们排除 |
「全部封禁 AI」不是最安全的默认做法,而是代价最高的默认做法。是否屏蔽,需要按用途类别权衡内容保护与被引用的机会,不能作为常规的基础维护措施统一执行。OpenAI 明确表示,内容要出现在 ChatGPT 搜索中并获得引用,前提就是不屏蔽其检索爬虫(见 Publishers and Developers FAQ)。
7. SEO 爬虫与 AI 爬虫:哪些基础不变,哪些做法已经变化
两者共用的抓取基础见 SEO vs GEO。这些基础没有改变,改变的是决定是否允许爬虫访问的方式。
以下要求始终不能放弃:页面可访问、返回 200、不会出现软 404,并保持合理的抓取预算和正确的状态码。Googlebot 一直要求满足这些基础条件,AI 爬虫同样如此。
| 维度 | SEO 爬虫时代 | AI 爬虫时代(变化) |
|---|---|---|
| 程序数量 | 主要只需关注一个爬虫(Googlebot) | 需要关注多个爬虫,而且新爬虫还在不断出现 |
| 访问规则的含义 | 只需决定是否允许索引 | 要分别决定是否允许训练、检索和用户触发三类用途,且不同决定带来的结果相反 |
| robots.txt | 既用于声明访问规则,爬虫也会严格遵守这项规范 | 仍可用于声明访问规则,但爬虫的遵守程度较低(§5) |
| 「提交进索引」 | 可以做到(站点地图、ping) | 只能部分做到,具体方法见 Sitemap 与 IndexNow |
问题在于,如果仍沿用 SEO 时代的做法,只设置一套 robots.txt 规则,并默认爬虫都会严格执行,就会忽略 AI 生态中爬虫数量众多、用途分为三类且规则遵守程度较低的现实。
8. AI 爬虫为何影响 GEO,以及该怎么做
页面能被抓取,只说明系统可以把它纳入候选集。这是必要条件,但并不足够。系统随后还要判断是否采信并引用该页面,详见 可引用性。
| 你的需求 | 参考内容 |
|---|---|
| 确认实际访问站点的爬虫身份 | AI 爬虫访问审计 |
| 制定访问规则 | robots.txt · llms.txt |
| 查询某个爬虫的 UA、IP 和屏蔽方法 | GPTBot · ClaudeBot · PerplexityBot |
| 确保爬虫能读取所抓取页面的内容 | SSR for AI Crawlers |
| 了解页面被检索后如何获得引用 | 可引用性 |
| 系统地掌握整套方法 | 生成式引擎优化 |
需要把三件事分开处理:是否屏蔽要按用途类别权衡,身份核验要在网络层完成,页面能否被读取取决于渲染方式。
参考资料
官方爬虫文档(截至 2026-05):
- OpenAI — Overview of OpenAI Crawlers · Publishers and Developers FAQ
- Anthropic — Does Anthropic crawl data from the web, and how can site owners block the crawler?
- Perplexity — Perplexity Crawlers
- Google Search Central — Overview of Google crawlers and fetchers · Google’s common crawlers (Google-Extended)
- Microsoft Bing — Which crawlers does Bing use?
协议与标准:
- IETF — RFC 9309: Robots Exclusion Protocol
- IETF — HTTP Message Signatures for automated traffic: Architecture (draft-meunier-web-bot-auth-architecture)(Internet-Draft;新兴,尚未成为标准)
独立数据与报道:
- Cloudflare — From Googlebot to GPTBot: who’s crawling your site in 2025
- Cloudflare — Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives
- TechCrunch — News outlets are accusing Perplexity of plagiarism and unethical web scraping
- Search Engine Land — Anthropic’s Claude bots make robots.txt decisions more granular
常见问题
什么是 AI 爬虫?
我该不该屏蔽 AI 爬虫来保护内容?
屏蔽了 GPTBot,是不是就退出 ChatGPT 了?
robots.txt 真能阻止 AI 爬虫吗?
日志里看到「GPTBot」,就能证明是 OpenAI 抓的吗?
延伸阅读
参考来源
一手来源
- Overview of OpenAI Crawlers (GPTBot / OAI-SearchBot / ChatGPT-User) · OpenAI
- Publishers and Developers FAQ — OpenAI Help Center · OpenAI
- Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic · 2026-04-07
- Perplexity Crawlers (PerplexityBot / Perplexity-User) · Perplexity AI
- Overview of Google crawlers and fetchers (user agents) · Google Search Central · 2026-02-09
- Google's common crawlers (Google-Extended) · Google Search Central · 2026-04-23
- Which crawlers does Bing use? · Microsoft Bing
- RFC 9309: Robots Exclusion Protocol · IETF · 2022-09-01
二手来源
- Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives · Cloudflare
- News outlets are accusing Perplexity of plagiarism and unethical web scraping · TechCrunch
- From Googlebot to GPTBot: who's crawling your site in 2025 · Cloudflare
- HTTP Message Signatures for automated traffic: Architecture (draft-meunier-web-bot-auth-architecture) · IETF (Internet-Draft)