免费 AI 爬虫访问检测工具
输入一个域名,查看它如何对待 26 个 AI 爬虫令牌:robots.txt 写了什么,边缘层实际放行了什么,以及屏蔽每一类分别要付出什么代价。
检测器抓取一次 robots.txt,按 RFC 9309 为全部令牌逐一判定,每条判定都引用它所依据的原行;随后以各爬虫的 UA 向同一页面各发一次探针,与浏览器基线对比差异,找出按 UA 设置的边缘层规则。
爬虫名录核对于 2026-08-18(对照各运营方官方文档)
训练类爬虫
屏蔽这一类,失去的是内容进入未来模型权重的机会:效果滞后且无法归因。它不会让你从 AI 答案里消失,引用由下面的检索类承载。
| 爬虫 | robots.txt | 边缘层响应 |
|---|---|---|
GPTBot · OpenAI | — | — |
ClaudeBot · Anthropic | — | — |
Google-Extended · Google 纯 robots.txt 令牌 官方文档 | — | 不发探针(纯 robots.txt 令牌) |
Applebot-Extended · Apple 纯 robots.txt 令牌 官方文档 | — | 不发探针(纯 robots.txt 令牌) |
CCBot · Common Crawl | — | — |
meta-externalagent · Meta | — | — |
Amazonbot · Amazon | — | — |
MistralAI-Training · Mistral AI | — | — |
AI2Bot · Allen Institute for AI | — | — |
Bytespider · ByteDance 被实测无视 robots.txt 无官方文档,旁证来源 blog.cloudflare.com | — | — |
检索类爬虫
屏蔽这一类,立刻失去引用:你会马上从 AI 答案里消失。其中 Googlebot、bingbot 与 Applebot 还同时承载传统搜索,屏蔽它们等于整体退出 Google、Bing 或 Siri 与 Spotlight,而不只是退出其 AI 功能。
用户触发类程序
屏蔽这一类,代价是某位用户对你页面的实时查询会当场失败。它挡不住任何自动化抓取:这些程序只在有人问到你的 URL 时才取页,而且其中几个在官方文档里就写明可以不遵循 robots.txt。
| 爬虫 | robots.txt | 边缘层响应 |
|---|---|---|
ChatGPT-User · OpenAI 自述可不遵循 robots.txt 官方文档 | — | — |
Claude-User · Anthropic | — | — |
Perplexity-User · Perplexity 自述可不遵循 robots.txt 官方文档 | — | — |
meta-externalfetcher · Meta 自述可不遵循 robots.txt 官方文档 | — | — |
MistralAI-User · Mistral AI | — | — |
Google-GeminiNotebook · Google 自述可不遵循 robots.txt 官方文档 | — | — |
Google-Agent · Google 自述可不遵循 robots.txt 官方文档 | — | — |
检测过程
- 抓取一次站点的 robots.txt,按 RFC 9309 解析:合并同名分组,User-agent 按最长令牌匹配,规则按最长路径优先,支持 * 与 $ 通配。
- 对全部 26 个令牌逐一判定首页路径的可达性,并给出每条判定所依据的 User-agent 分组与规则原行。
- 用普通浏览器 UA 抓取一次首页,作为所有探针的对比基线。
- 对 24 个可探测的爬虫 UA 各发一次请求(Google-Extended 与 Applebot-Extended 只存在于 robots.txt 中,不发探针),只读取状态码与响应头。
- 报告差异:浏览器拿到页面而某个爬虫 UA 收到 403、429 或质询,说明边缘层存在按 UA 设置的规则;若站点连浏览器基线都拦截,探针结果一律标记为无法判定,而不是猜测。
这个检测能看到什么、看不到什么
- UA 只是声明,不是身份。探针带着各爬虫的 UA 字符串,但从我们服务器的 IP 发出;按 IP 段或反向 DNS 验证爬虫身份的边缘层,可能把探针当成冒名者。因此边缘层「拦截」只说明存在按 UA 设置的规则,不代表真实爬虫被挡在门外。验证机制详见 AI 爬虫。
- 爬虫与浏览器得到相同响应,只说明没有观察到 UA 级规则,不代表真实爬虫一定进得来:IP 级与已验证爬虫(verified bots)机制对这项测试不可见。
- robots.txt 是自愿遵守的请求,不是访问控制(RFC 9309)。名录中标注了运营方自述用户触发抓取可不遵循它的程序,以及被实测无视它的爬虫。
- 判定针对首页路径。站点可以放行首页、同时禁止真正重要的路径;带有路径级规则的行会标注「部分路径受限」。
常见问题
该不该屏蔽 AI 训练类爬虫?
这是一个政策选择,也是唯一没有即时可见度代价的屏蔽:挡住训练类,内容不进入未来模型权重,检索类照常引用你。代价高的是反向操作,也就是把所有 AI 爬虫一律封禁,让自己悄悄从 AI 答案里消失。类别之间的不对称详见 AI 爬虫。
robots.txt 显示屏蔽,边缘层探针却显示放行,哪个才对?
都对,因为它们测的是不同层面:robots.txt 是你声明的政策,守规矩的爬虫在抓取前会先读它;探针测的是服务器实际执行了什么。守规矩的爬虫读到 Disallow 后根本不会发出请求,边缘层自然无从拦截。
边缘层探针显示拦截,真实爬虫就一定被挡住了吗?
不一定。探针带着爬虫的 UA 字符串,却从我们的 IP 发出;按 IP 或反向 DNS 验证身份的 WAF 会把它当成冒名者拦下,同时放行货真价实的爬虫。边缘层「拦截」应读作「边缘层存在按 UA 设置的规则」,最终以你自己的服务器日志为准。
为什么从不对 Google-Extended 和 Applebot-Extended 发探针?
因为它们不发出任何 HTTP 请求。两者都是只在 robots.txt 中生效的控制令牌:实际抓取由 Googlebot 与 Applebot 完成,这两个令牌只决定抓到的内容能否用于模型训练。对一个线上并不存在的 UA 发探针测不出任何东西,所以工具只在 robots.txt 层面判定它们。
屏蔽 Googlebot 或 bingbot 只影响 AI 功能吗?
不是,这是整页代价最高的屏蔽。Google 的 AI Overviews 与 AI Mode 建立在 Googlebot 的常规抓取之上,微软也没有为 Copilot 单独设立爬虫,所以屏蔽任何一个都会让你同时退出 Google 或 Bing 的传统搜索。训练用途另有开关:Google 用 Google-Extended 控制,Bing 用内容控制标签而非屏蔽爬虫。