跳到正文
进阶 预计耗时: 12 分钟
第 1 步,共 8 步

AI 爬虫的三类用途

修改 robots.txt 前,先确认哪些系统正在请求页面,以及每类请求服务于什么用途。只有区分模型训练、搜索检索和用户触发抓取,才能按实际用途制定访问策略,避免误以为同一厂商旗下的所有爬虫都承担相同职责。

本步阅读

  1. AI 爬虫
    Wiki
  2. ChatGPT-User
    Wiki

自测

  • 日志中出现了哪些主流 AI 爬虫,如何通过用户代理标识识别它们?
  • 为什么有些引擎没有直接抓取站点内容,却仍然可能引用该站点?
  • 哪些爬虫用于模型训练,哪些会在用户提问时实时抓取内容?