GPTBot
速览要点
- 它是什么
- OpenAI 的训练爬虫:抓取的内容可能被用于训练未来的基础模型;除此之外,它不参与任何实时应答
- UA 字符串
- Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot。写规则时只匹配 GPTBot 这个名字本身,不要把版本号写进去
- robots.txt
- OpenAI 有明确文档,GPTBot 会遵守。官方写明:「对 GPTBot 设置 Disallow,表示该站点的内容不应被用于训练生成式 AI 基础模型」
- 对 ChatGPT 搜索的影响
- 没有影响。管搜索收录的是 OAI-SearchBot,管实时取页的是 ChatGPT-User。屏蔽 GPTBot 不会让你少一次引用
- 必须讲清楚的一点
- 没有任何已发表的证据表明放行 GPTBot 能带来更多引用或提及。机制上说得通,但那不等于效果已经被测出来,而且按现有方法根本测不出来
1. GPTBot 是什么
GPTBot 是 OpenAI 用来收集公开可抓取内容的爬虫,这些内容可能被用于训练它的基础模型。OpenAI 自己给的描述范围很窄,就该按这个范围来理解:它「用于抓取可能被用于训练我们生成式 AI 基础模型的内容」(见 Overview of OpenAI Crawlers)。
它按 OpenAI 自己的排期去抓,只服务训练这一个用途。它不回答任何提问,也不参与任何实时应答。
围绕这个爬虫的所有麻烦,都出自同一个性质:一次 GPTBot 抓取留下的不是一次引用、一条链接或一次曝光,而是对模型权重的一份贡献。这份贡献无法归因到你,几个月之内都不会显现出来,也永远不会出现在任何报表里。要不要放行它,等于要为一份谁也观察不到的收益做决定。
在 OpenAI 的这一组程序里,GPTBot 只负责训练;与它并列的另外两个是 OAI-SearchBot(搜索索引)和 ChatGPT-User(代表用户当场取页)。这四个令牌同属 OpenAI。屏蔽其中一个和屏蔽另一个,后果为什么完全不同,完整的推演见 AI 爬虫。
上线时间对 GPTBot 格外重要。它在 2023 年 8 月上线,是第一个公开了专用令牌、允许站点直接退出的主流训练爬虫,此后几乎每一份「屏蔽 AI」教程都把它当成默认目标,其中相当一部分屏错了对象。
2. 在日志里辨认 GPTBot
OpenAI 公布的用户代理字符串:
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot
规则只匹配 GPTBot 这个名字本身,不要把版本号写进去。OpenAI 把这条标注为示例,并说明版本号可能变化,而它确实变过:GPTBot/1.2 早就是旧版本,却仍被大量博客和规则模板照抄至今。把版本号写死的规则,会在版本一变的那天悄无声息地失效。
文档里还有一处细节容易被略过,但在确认一次策略调整有没有生效时很有用。OpenAI 写明:「抓取 robots.txt 文件时,我们可能会在用户代理字符串中加入一个 robots.txt 标记,帮助站点所有者把这类请求与其他资源的请求区分开。」这个标记的具体文本没有公布,所以它只能当作一个值得留意的信号,不能直接拿去做字符匹配。它真正有用的地方在于:日志里出现一次 /robots.txt 请求,来源又是已确认的 GPTBot 地址,那就是新指令确实被读到的最省事的证据。
GPTBot 公布了自己使用的地址段,而这份文件本身长什么样,就是一项可以直接核实的事实。下面这组数字取自 OpenAI 的公开端点,取回时间是 2026 年 7 月 28 日,重叠情况逐段比对过:
| 令牌 | 公布的 IP 文件 | 网段数 | 文件生成时间 | 重叠情况 |
|---|---|---|---|---|
| GPTBot | gptbot.json | 21 | 2025-10-30 | 与 OAI-SearchBot 共用 6 段 |
| OAI-SearchBot | searchbot.json | 35 | 2026-01-02 | 与 GPTBot 共用 6 段 |
| ChatGPT-User | chatgpt-user.json | 286 | 2026-07-23 | 与两者均无重叠 |
这张表说明两件事。GPTBot 占用的地址段很少,与搜索爬虫共用 6 个网段,与用户触发的那个取页程序则一段都不共用。另外,训练爬虫这份地址文件相对静止:到这个日期为止,它已有大约九个月没有重新生成,而 ChatGPT-User 那一份是五天前刚生成的。这只是文件更新节奏上的差别,据此推断抓取量的多少并不成立。
这处重叠,OpenAI 的文档里有解释:「如果你的站点同时放行了这两个程序,我们可能只用一次抓取的结果来同时服务两个用途,以避免重复抓取。」厂商的说法和地址数据能对上,而证据也只到这一步:由此并不能推出屏蔽 GPTBot 会抬高 OAI-SearchBot 的请求量,也不能推出同时放行两者可以减轻服务器负担。这两种说法都没有公开依据。
核验要看 IP,再配合 AI 爬虫 里说明的前向确认反向解析(forward-confirmed reverse DNS)。日志里出现 GPTBot 这串字符本身什么都证明不了:它恰恰因为最有名,成了这一类里被冒用最多的令牌。具体该 grep 什么、怎么确认真正到达服务器的是谁,见 AI 爬虫访问审计。
3. robots.txt 退出机制,以及它管不到的地方
OpenAI 有明确文档,GPTBot 会遵守 robots.txt。文档的开头一句就点了它的名字:「OpenAI 使用 OAI-SearchBot 和 GPTBot 的 robots.txt 标签,让站长管理自己的站点和内容如何与 AI 交互。」后果写得同样直白:「对 GPTBot 设置 Disallow,表示该站点的内容不应被用于训练生成式 AI 基础模型。」
这一处没有含糊的余地:让 ChatGPT-User 变复杂的那条「用户发起」例外,对一个按排期抓取的爬虫并不适用。
最小指令:
User-agent: GPTBot
Disallow: /
也可以按路径设置,排除一个目录同时保留其中一部分公开内容:
User-agent: GPTBot
Disallow: /members/
Allow: /members/public-report/
对那份公开报告来说,更长、更具体的 Allow 优先生效。分组合并、路径优先级、大小写敏感、host 范围,这些都遵循 robots.txt 里的通用规则;放行与屏蔽之间的那条边界,与其想当然,不如实测一次。
生效不是即时的,而且 OpenAI 公布的那个时长,适用范围比它被转述时窄得多。原话是:「就搜索结果而言,请注意从站点更新 robots.txt 到我们的系统作出调整,可能需要约 24 小时。」这句话只针对搜索结果。训练抓取要多久才响应新指令,OpenAI 没有公布,所以没有文档能为 GPTBot 给出一个确定的生效时间。
退出机制有三条硬性限制:
- 不能追溯。Disallow 只对之后的抓取生效,无法把内容从已经训练好的模型里移出来,OpenAI 也没有任何机制能做到这件事(见 §6)。
- 不是强制手段。RFC 9309 写明其规则「并不构成一种访问授权」,协议本身也「不能替代有效的内容安全措施」。真正不能被读到的内容,要靠鉴权来挡,而不是一份文本文件。
- 管不到语料这一层。对 GPTBot 设置 Disallow,管的只是 OpenAI 自己的爬虫。有些内容已经被收进第三方的网络语料库,模型开发方照样会取用,这部分它管不到;其他机构运营的爬虫,它同样管不到。
至于 llms.txt,没有任何文档说明它能用来表达训练授权,发布一份也不会改变 GPTBot 的行为。
4. 屏蔽 GPTBot 会发生什么,不会发生什么
屏蔽 GPTBot 不会把你移出 ChatGPT。实时答案来自 OAI-SearchBot 和 ChatGPT-User,前者构建搜索索引,后者在有人问到你这一页时当场取页,GPTBot 两件事都不参与。一个站点完全可以屏蔽它,同时在 ChatGPT 里照常被引用。
反方向的那个错误代价更大,被讨论得却少得多:为了「不让 AI 拿走我的内容」而对 OAI-SearchBot 设置 Disallow,等于当场把引用让出去,换来的只是去拦一件本该由另一个令牌管的训练行为。
| 做法 | 背后的想法 | 实际结果 |
|---|---|---|
| 屏蔽 GPTBot 以退出 ChatGPT | 「它是 OpenAI 的爬虫」 | 对 ChatGPT 搜索和实时答案毫无影响,管那两件事的是 OAI-SearchBot 和 ChatGPT-User |
| 屏蔽 GPTBot 以撤回过去的训练 | 「退出就该是彻底退出」 | 只对之后的抓取生效,已经训练进模型的内容不受影响 |
对所有 AI 程序一律 Disallow: / | 「保护内容」 | 为了拦训练,把引用也一并拦掉了;这两类爬虫的代价完全不在一个方向上 |
| 放行 GPTBot,指望换来更多引用 | 「进了模型就有好处」 | 没有任何已发表证据支持引用会因此提升(见 §5) |
| 把 Disallow 当成一种授权主张 | 「我已经保留了权利」 | 它只是一份自愿遵守的请求,既不是法律文书,本身也没有强制力 |
训练与检索的这条分野,同样决定了 Anthropic 的训练爬虫 ClaudeBot 该怎么处理。Google-Extended 达到的效果相近,实现方式却完全不同:它只是一个控制令牌,背后既没有爬虫,也没有自己的用户代理字符串。PerplexityBot 则完全属于检索那一侧,它面对的根本不是同一个决定。
5. 放行它对 GEO 有回报吗
其他几个同类爬虫都能指向一个明确的引用后果,GPTBot 指不出来,这一点没有必要绕开。
有两种机制经常被混为一谈,把它们分开,多数争论就结束了:
| 机制 | 产出什么 | 由哪个程序决定 | 能否测量 |
|---|---|---|---|
| 检索采信(retrieval grounding) | 当场的一次带出处的引用 | OAI-SearchBot、ChatGPT-User | 能,可以逐条追踪 |
| 参数化记忆(parametric recall) | 模型对你形成的先验印象,不带任何出处 | GPTBot,以及其他语料来源 | 不能,无法归因 |
第二行的机制是真实存在的。训练时吸收的内容,确实可能影响模型对某个实体的判断,这和品牌提及起作用的方式是一样的:不靠链接,也能让模型知道你。
但机制成立不等于效果已被测出,而且这里的缺口是结构性的,不是「还没有人去研究」那么简单。知识归因方向的研究说得很直接:语言模型「往往并不知道这些知识的来源」;要把模型输出追溯回产生它的那些文档,需要在训练阶段就做专门设计,事后分析做不到(见 Khalifa 等,2024)。而要证明放行 GPTBot 有回报,需要的恰恰就是这种归因能力,常规训练出来的模型并不具备。
所以准确的说法是:没有任何已发表研究把「站点是否放行 GPTBot」单独作为变量,证明它带来了引用或提及的提升。这个对照从根上就做不出来:你无法对一次训练做 A/B,无法观察自己的内容在模型权重里留下了什么,也无法把一次无来源的提及归到某一次抓取上。
这种不对称并不等于「先屏蔽再说」更划算。放行的代价是分散的:一些带宽,以及一次没有去争取的授权谈判机会。而与这个决定常常一起发生的,是恐慌式屏蔽,它的代价具体而且即时:同一次改动往往会把检索爬虫一并扫进去。回报测不出来的那个爬虫,并不是多数屏蔽决定真正伤到的那一个。
很多出版方屏蔽 GPTBot,理由根本不在 GEO 这一侧:内容授权的谈判筹码、版权政策、法律立场、基础设施成本。这些理由都站得住,很多时候还更正当,不该用可见性的标准去衡量。从可见性角度只能给出一句更窄的判断:这个决定不该建立在对引用收益的预期上,指望它增加不行,担心它减少也不行,因为那种收益从未被证明过。可见性上真正有答案的问题都在检索那一侧,见生成式引擎优化。
6. 围绕这个爬虫长出来的补偿层
「出版方是否应该获得报酬」这场讨论,正是围绕 GPTBot 这个令牌展开的。今天要不要放行它,都是在这个背景下做的判断。
Media Manager 始终没有上线。2024 年 5 月 7 日,OpenAI 宣布了一个工具,让创作者标明自己的作品并指定是否纳入 AI 训练,当时的说法是:「目标是在 2025 年之前让这个工具就位」(见 TechCrunch)。这个期限过去了,工具没有出现(见 TechCrunch,2025 年 1 月 1 日);至今 OpenAI 也没有宣布过任何上线消息。所以到今天为止,robots.txt 仍然是唯一真实存在的退出机制。
与之并行的是谈判这条路。OpenAI 已经和相当数量的出版方签下内容授权协议,这是令牌之外的一个真实选项,但对绝大多数站点来说,体量根本不够谈。对这些协议之外的所有人来说,§3 里那条指令就是全部工具。
变化最快的是网络这一层。robots.txt 只能提出请求,Cloudflare 现在给出的默认设置却可以直接执行,其中有一个日期需要提前安排:从 2026 年 9 月 15 日起,「在展示广告的页面上,训练类和 agent 类将默认屏蔽,搜索类仍然默认放行」(见 Cloudflare)。GPTBot 是单一用途的训练爬虫,所以它明确属于被屏蔽的那一类,不存在多用途爬虫那种归类上的争议。这套默认值作用于新接入的域名,已有客户可以在此之前先设定自己的偏好。Cloudflare 另外还提供一份托管的 robots.txt,代站点写入 AI 训练相关的指令(见 Cloudflare,2025 年 7 月 1 日)。
在证据允许的范围内可以这样概括:对这个爬虫的控制权,正在从一份自愿性质的文本文件,转移到网络层和合同上。
7. 有多少站点屏蔽它,它又抓了多少
这里每一个数字都取决于它的分母,而 GPTBot 的统计数字是这个领域里被引用最多、也被误读最多的一批。一份精选的主流新闻站点名单,和一份覆盖普通域名的宽口径抽样,对同一个爬虫给出的数字可以差好几倍,而放回各自的样本里看,两个数字都没错。
差距本身就是结论:
| 来源与时间 | 样本口径 | 数字 |
|---|---|---|
| Reuters Institute,2023 年底 | 10 个国家、各 15 家最常用新闻站点 | 48% 屏蔽了 OpenAI 的爬虫,其中美国 79%,墨西哥和波兰各 20% |
| Cloudflare,2025 年 7 月 1 日 | 头部域名中已有的 robots.txt 文件 | 7.8% 对 GPTBot 设置了 Disallow |
两者并不矛盾,它们回答的是不同的问题。Cloudflare 还给出了一个能把两个数字对上的事实:头部一万个域名里,只有约 37% 有 robots.txt 文件。网络上的大多数站点在这件事上根本没有表态,所以任何形如「X% 的网站屏蔽了 GPTBot」的说法,不说清分母是什么就没有意义。
不同来源都指向同一个方向:从 GPTBot 2023 年 8 月上线到 2025 年,屏蔽比例大幅上升,而且集中在大型出版方,并不是均匀分布。
抓取量这边,与其堆几个含糊的数字,不如认准一个口径清楚的。整个 2025 年,在 Cloudflare 网络上 GPTBot 约占已核验爬虫流量的 7.5%,而 Googlebot 超过 28%(见 Cloudflare Radar 2025 年度回顾)。训练始终是占比最高的用途:在 2025 年 7 月的一个观测窗口里,训练接近 AI 爬虫抓取量的 80%(见 Cloudflare);同期用户触发的那一类从很低的基数增长了二十倍以上。
引用这个爬虫的数字时,有两点必须守住。谈 2025 年的数字要讲明那是当时的情况:2026 年各家程序的月度排名多次易位,竞争对手的爬虫在不同月份都领先过,所以「GPTBot 是最大的 AI 爬虫」并不是当前数据支持的说法,而在上面引用的那份 Cloudflare 网络数据里,它从来就不是最大的。另外,第三方追踪机构给出的月度单程序排名要谨慎对待:各家彼此对不上,样本口径不公开,而且往往在所描述的月份过去很久之后还在被反复转引。
8. 如何选择策略
| 想达到的目的 | 指令 | 代价 |
|---|---|---|
| 保持可被引用,同时拒绝训练 | 对 GPTBot 设 Disallow,放行 OAI-SearchBot 和 ChatGPT-User | 引用这一侧没有损失;放弃的是参数化记忆那份收益,而它从未被测量过 |
| 两者都允许 | 不对 GPTBot 设 Disallow | 内容会继续按 OpenAI 说明的训练用途被使用 |
| 保住授权谈判的位置 | 对 GPTBot 设 Disallow,同时配合网络层控制与合同 | 单靠 robots.txt 只是一份请求,不构成权利保留 |
| 按路径区分 | 对 GPTBot 在某个子树下设 Disallow,放行其中一部分公开内容 | 需要实测那条边界,方法见 robots.txt |
| 彻底退出 AI 答案 | 这是另一个决定,动的是检索侧的令牌,不是这一个 | 引用即时、彻底地消失,判断依据见 AI 爬虫 |
把这个决定记成一条策略,而不只是改一次文件:想达到的用途、负责人、涉及的主机与协议、具体写了哪些指令、上线日期,以及下次复核的日期。要核实源站实际返回了什么、真正到达的又是谁,见 AI 爬虫访问审计。
复核日期要认真设。令牌本身从 2023 年至今很稳定,围绕它的一切却不然:说好 2025 年就位的退出工具始终没有出现,一项 CDN 默认设置将在 2026 年 9 月改变,授权这一层两年里换了两次形态。一个做完就再没回看过的决定,面对的是一个已经不存在的局面。
9. 相关条目
- AI 爬虫:三分类模型,以及如何按类别决定放行还是屏蔽
- OAI-SearchBot:OpenAI 的搜索索引程序,管搜索收录的是它
- ChatGPT-User:OpenAI 代表用户当场取页的程序,以及 robots.txt 为何未必约束它
- ClaudeBot:Anthropic 的训练爬虫,同样的决定换到另一家怎么做
- Google-Extended:一种没有爬虫、只有控制令牌的训练管控方式
- PerplexityBot:检索那一侧的对比案例
- robots.txt:协议本身,以及指令是怎么被解析的
- llms.txt:它是什么,以及它控制不了什么
- OpenAI:这四个令牌背后的运营方
- 品牌提及:参数化记忆真要起作用,靠的就是这种实体先验
- 生成式引擎优化:检索那一侧能回答的可见性问题
- AI 爬虫访问审计:核验真正到达服务器的是谁
- ChatGPT 搜索:GPTBot 并不参与的那个引擎
参考资料
Primary
- OpenAI — Overview of OpenAI Crawlers
- OpenAI — GPTBot published IP ranges · OAI-SearchBot ranges · ChatGPT-User ranges
- IETF — RFC 9309: Robots Exclusion Protocol
- Cloudflare — Your site, your rules: new AI traffic options for all customers(2026 年 7 月 1 日)
- Cloudflare — Control content use for AI training with managed robots.txt(2025 年 7 月 1 日)
- Khalifa、Wadden、Strubell、Lee、Wang、Beltagy、Peng — Source-Aware Training Enables Knowledge Attribution in Language Models(2024 年 4 月)
- Reuters Institute — How many news websites block AI crawlers?
Secondary
- Cloudflare — The 2025 Cloudflare Radar Year in Review
- Cloudflare — A deeper look at AI crawlers: traffic by purpose and industry(2025 年 8 月 28 日)
- TechCrunch — OpenAI says it’s building a tool to let content creators opt out of AI training(2024 年 5 月 7 日)
- TechCrunch — OpenAI failed to deliver the opt-out tool it promised by 2025(2025 年 1 月 1 日)
常见问题
GPTBot 是什么?
屏蔽 GPTBot,我会从 ChatGPT 里消失吗?
设置 Disallow 之后,已经训练进去的内容会被移除吗?
从 GEO 角度看,有理由放行 GPTBot 吗?
屏蔽 GPTBot 会连带屏蔽 OpenAI 的搜索爬虫吗?
延伸阅读
参考来源
一手来源
- Overview of OpenAI Crawlers · OpenAI
- GPTBot published IP ranges (gptbot.json) · OpenAI
- OAI-SearchBot published IP ranges (searchbot.json) · OpenAI
- ChatGPT-User published IP ranges (chatgpt-user.json) · OpenAI
- RFC 9309: Robots Exclusion Protocol · IETF · 2022-09-01
- Your site, your rules: new AI traffic options for all customers · Cloudflare · 2026-07-01
- Control content use for AI training with Cloudflare's managed robots.txt · Cloudflare · 2025-07-01
- Source-Aware Training Enables Knowledge Attribution in Language Models · Khalifa et al. (arXiv) · 2024-04-01
- How many news websites block AI crawlers? · Reuters Institute for the Study of Journalism
二手来源
- A deeper look at AI crawlers: breaking down traffic by purpose and industry · Cloudflare
- The 2025 Cloudflare Radar Year in Review · Cloudflare
- OpenAI says it's building a tool to let content creators opt out of AI training · TechCrunch
- OpenAI failed to deliver the opt-out tool it promised by 2025 · TechCrunch