跳到正文

免费 AI 爬虫访问检测工具

输入一个域名,查看它如何对待 26 个 AI 爬虫令牌:robots.txt 写了什么,边缘层实际放行了什么,以及屏蔽每一类分别要付出什么代价。

免费使用,无需注册:每天 5 次;登录后每天 15 次。 使用 Google 登录

检测器抓取一次 robots.txt,按 RFC 9309 为全部令牌逐一判定,每条判定都引用它所依据的原行;随后以各爬虫的 UA 向同一页面各发一次探针,与浏览器基线对比差异,找出按 UA 设置的边缘层规则。

爬虫名录核对于 2026-08-18(对照各运营方官方文档)

训练类爬虫

屏蔽这一类,失去的是内容进入未来模型权重的机会:效果滞后且无法归因。它不会让你从 AI 答案里消失,引用由下面的检索类承载。

爬虫 robots.txt 边缘层响应
GPTBot · OpenAI
ClaudeBot · Anthropic
Google-Extended · Google
纯 robots.txt 令牌 官方文档
不发探针(纯 robots.txt 令牌)
Applebot-Extended · Apple
纯 robots.txt 令牌 官方文档
不发探针(纯 robots.txt 令牌)
CCBot · Common Crawl
meta-externalagent · Meta
Amazonbot · Amazon
MistralAI-Training · Mistral AI
AI2Bot · Allen Institute for AI
Bytespider · ByteDance
被实测无视 robots.txt 无官方文档,旁证来源 blog.cloudflare.com

检索类爬虫

屏蔽这一类,立刻失去引用:你会马上从 AI 答案里消失。其中 Googlebot、bingbot 与 Applebot 还同时承载传统搜索,屏蔽它们等于整体退出 Google、Bing 或 Siri 与 Spotlight,而不只是退出其 AI 功能。

爬虫 robots.txt 边缘层响应
OAI-SearchBot · OpenAI
Claude-SearchBot · Anthropic
PerplexityBot · Perplexity
Googlebot · Google
兼营传统搜索 官方文档
bingbot · Microsoft
兼营传统搜索 官方文档
Applebot · Apple
兼营传统搜索 官方文档
DuckAssistBot · DuckDuckGo
YouBot · You.com
MistralAI-Index · Mistral AI

用户触发类程序

屏蔽这一类,代价是某位用户对你页面的实时查询会当场失败。它挡不住任何自动化抓取:这些程序只在有人问到你的 URL 时才取页,而且其中几个在官方文档里就写明可以不遵循 robots.txt。

爬虫 robots.txt 边缘层响应
ChatGPT-User · OpenAI
自述可不遵循 robots.txt 官方文档
Claude-User · Anthropic
Perplexity-User · Perplexity
自述可不遵循 robots.txt 官方文档
meta-externalfetcher · Meta
自述可不遵循 robots.txt 官方文档
MistralAI-User · Mistral AI
Google-GeminiNotebook · Google
自述可不遵循 robots.txt 官方文档
Google-Agent · Google
自述可不遵循 robots.txt 官方文档

检测过程

  1. 抓取一次站点的 robots.txt,按 RFC 9309 解析:合并同名分组,User-agent 按最长令牌匹配,规则按最长路径优先,支持 * 与 $ 通配。
  2. 对全部 26 个令牌逐一判定首页路径的可达性,并给出每条判定所依据的 User-agent 分组与规则原行。
  3. 用普通浏览器 UA 抓取一次首页,作为所有探针的对比基线。
  4. 对 24 个可探测的爬虫 UA 各发一次请求(Google-Extended 与 Applebot-Extended 只存在于 robots.txt 中,不发探针),只读取状态码与响应头。
  5. 报告差异:浏览器拿到页面而某个爬虫 UA 收到 403、429 或质询,说明边缘层存在按 UA 设置的规则;若站点连浏览器基线都拦截,探针结果一律标记为无法判定,而不是猜测。

这个检测能看到什么、看不到什么

常见问题

该不该屏蔽 AI 训练类爬虫?
这是一个政策选择,也是唯一没有即时可见度代价的屏蔽:挡住训练类,内容不进入未来模型权重,检索类照常引用你。代价高的是反向操作,也就是把所有 AI 爬虫一律封禁,让自己悄悄从 AI 答案里消失。类别之间的不对称详见 AI 爬虫
robots.txt 显示屏蔽,边缘层探针却显示放行,哪个才对?
都对,因为它们测的是不同层面:robots.txt 是你声明的政策,守规矩的爬虫在抓取前会先读它;探针测的是服务器实际执行了什么。守规矩的爬虫读到 Disallow 后根本不会发出请求,边缘层自然无从拦截。
边缘层探针显示拦截,真实爬虫就一定被挡住了吗?
不一定。探针带着爬虫的 UA 字符串,却从我们的 IP 发出;按 IP 或反向 DNS 验证身份的 WAF 会把它当成冒名者拦下,同时放行货真价实的爬虫。边缘层「拦截」应读作「边缘层存在按 UA 设置的规则」,最终以你自己的服务器日志为准。
为什么从不对 Google-Extended 和 Applebot-Extended 发探针?
因为它们不发出任何 HTTP 请求。两者都是只在 robots.txt 中生效的控制令牌:实际抓取由 Googlebot 与 Applebot 完成,这两个令牌只决定抓到的内容能否用于模型训练。对一个线上并不存在的 UA 发探针测不出任何东西,所以工具只在 robots.txt 层面判定它们。
屏蔽 Googlebot 或 bingbot 只影响 AI 功能吗?
不是,这是整页代价最高的屏蔽。Google 的 AI Overviews 与 AI Mode 建立在 Googlebot 的常规抓取之上,微软也没有为 Copilot 单独设立爬虫,所以屏蔽任何一个都会让你同时退出 Google 或 Bing 的传统搜索。训练用途另有开关:Google 用 Google-Extended 控制,Bing 用内容控制标签而非屏蔽爬虫。