跳到正文
进阶 预计耗时: 12 分钟
第 3 步,共 8 步

robots.txt 与访问控制

robots.txt 表达的是站点对爬虫访问的偏好,不能替代网络层的强制访问控制。应先理解用户代理规则组和路径优先级,再对照各爬虫公开的行为说明及服务器实际日志,最后决定站点应允许或拒绝哪些请求。

本步阅读

  1. robots.txt
    Wiki
  2. Google-Extended
    Wiki

自测

  • 如何编写只允许特定 AI 爬虫访问的 robots.txt 规则?
  • Allow 与 Disallow 规则发生冲突时,路径优先级如何判断?
  • 哪些 AI 爬虫会遵守 robots.txt,哪些曾有公开的违规记录?