跳到正文

免费 AI 爬虫访问检测工具

输入域名,查看 robots.txt 允许哪些 AI 爬虫访问、边缘层如何响应不同爬虫 UA,以及相关限制可能影响哪些用途。

免费使用,无需账号。每天可检测 5 次;登录后每天可检测 15 次。 使用 Google 登录

检测器读取一次 robots.txt,按照 RFC 9309 逐一判断所有令牌,并显示每项结果依据的规则。随后将部分爬虫 UA 的响应与浏览器基线对比,帮助发现可能存在的 CDN 或 WAF 差异。

爬虫名录已于 2026-08-18 对照运营方文档核验

训练类爬虫

屏蔽这类爬虫,可能会阻止内容被用于未来的模型训练,但不会直接决定检索系统能否发现或引用你的页面。

爬虫 robots.txt 边缘层响应
GPTBot · OpenAI
ClaudeBot · Anthropic
Google-Extended · Google
仅用于 robots.txt 官方文档
未测试,仅用于 robots.txt
Applebot-Extended · Apple
仅用于 robots.txt 官方文档
未测试,仅用于 robots.txt
CCBot · Common Crawl
meta-externalagent · Meta
Amazonbot · Amazon
MistralAI-Training · Mistral AI
AI2Bot · Allen Institute for AI
Bytespider · ByteDance
实测中未遵循 robots.txt 暂无官方文档,参考来源 blog.cloudflare.com

检索类爬虫

屏蔽这类爬虫可能会降低网站在 AI 搜索和引用中的可见度。Googlebot、bingbot 与 Applebot 还用于传统搜索或内容发现,因此影响可能不只限于 AI 功能。

爬虫 robots.txt 边缘层响应
OAI-SearchBot · OpenAI
Claude-SearchBot · Anthropic
PerplexityBot · Perplexity
Googlebot · Google
也用于传统搜索 官方文档
bingbot · Microsoft
也用于传统搜索 官方文档
Applebot · Apple
也用于传统搜索 官方文档
DuckAssistBot · DuckDuckGo
YouBot · You.com
MistralAI-Index · Mistral AI

用户触发类程序

屏蔽这类程序,可能会导致 AI 产品在用户主动请求时无法打开你的页面。部分运营方对用户发起的访问采用不同的 robots.txt 处理方式,请结合每个程序的说明判断。

爬虫 robots.txt 边缘层响应
ChatGPT-User · OpenAI
运营方说明处理方式不同 官方文档
Claude-User · Anthropic
Perplexity-User · Perplexity
运营方说明处理方式不同 官方文档
meta-externalfetcher · Meta
运营方说明处理方式不同 官方文档
MistralAI-User · Mistral AI
Google-GeminiNotebook · Google
运营方说明处理方式不同 官方文档
Google-Agent · Google
运营方说明处理方式不同 官方文档

检测过程

  1. 按照 RFC 9309 抓取并解析 robots.txt,包括分组合并、User-agent 匹配、规则优先级,以及 * 和 $ 通配符。
  2. 检查全部 26 个令牌对首页路径的访问规则,并显示每项结果对应的 User-agent 分组和规则。
  3. 使用常规浏览器 UA 请求首页,建立对比基线。
  4. 对可以测试的爬虫 UA 分别发送一次轻量请求。Google-Extended 与 Applebot-Extended 只作为 robots.txt 令牌进行判断。
  5. 比较响应差异。如果浏览器可以访问,而某个爬虫 UA 收到拦截、验证或不同的重定向,就标记为可能存在按 UA 设置的边缘层规则。如果浏览器基线也被拦截,则结果记为无法判断。

这个检测能看到什么、看不到什么

常见问题

该不该屏蔽 AI 训练类爬虫?
这取决于你的内容政策。训练类和检索类爬虫用途不同,因此可以限制训练用途,同时保留 AI 搜索访问。不要对所有 AI 相关 UA 套用同一条规则,建议逐个核对。类别说明见 AI 爬虫
robots.txt 显示屏蔽,边缘层探针却显示放行,哪个才对?
两者都可能正确,因为检测的是不同层面。robots.txt 表达抓取规则,边缘层探针则测试服务器在收到请求后返回什么。遵循 Disallow 的爬虫可能根本不会发出该请求。
边缘层探针显示拦截,真实爬虫就一定被挡住了吗?
不一定。探针使用爬虫的 UA 字符串,但请求来自我们的 IP。按 IP 或反向 DNS 验证身份的 WAF,可能拦截探针却放行真实爬虫。请结合自己的服务器或 CDN 日志确认。
为什么不对 Google-Extended 和 Applebot-Extended 做边缘层测试?
它们是 robots.txt 中的控制令牌,并不是用于单独请求页面的爬虫 UA。实际抓取由 Googlebot 与 Applebot 完成,因此本工具只在 robots.txt 中判断这两个 Extended 令牌。
屏蔽 Googlebot 或 bingbot 只影响 AI 功能吗?
不是。Googlebot 与 bingbot 也用于传统搜索,因此屏蔽它们的影响可能超出 AI 功能。若平台提供独立的训练控制,应优先使用,并在修改范围较大的规则前核对运营方文档。
首次发布: 最近更新: