跳到正文

Google-Extended

速览要点

它是什么
robots.txt 中的一项独立产品令牌,用来决定 Google 抓取的内容能否用于官方列出的后续用途
HTTP 用户代理
不存在。请求仍由 Google 现有的用户代理发出,因此日志中不会出现独立的 Google-Extended 标识
它控制哪些用途
Google 官方列出的未来 Gemini 模型训练,以及 Gemini Apps 和部分 Google Cloud 产品中的 Google 搜索采信
对 Google 搜索的影响
不影响普通搜索的收录或排名;搜索 AI 中的展示与采信由另一项正在向部分站长开放的 Search Console 功能控制
主要取舍
禁止后,符合条件的模型训练会受限,也会失去官方列出的实时采信机会;Google 没有为这两类用途分别提供开关

Google-Extended 是 robots.txt 中控制内容后续用途的开关,并不是拥有独立请求身份的 AI 爬虫。

1. Google-Extended 是什么

Google-Extended 是一项可写入 robots.txt User-agent: 字段的独立产品令牌(product token)。Google 根据相应规则,决定现有爬虫抓取的内容能否用于官方列出的 Gemini 训练,或作为采信(grounding)依据(见 Google’s common crawlers)。

这里有两个概念不能混为一谈。这个令牌使用 robots.txt 的语法,但并不代表一个 HTTP 客户端。Google 明确说明,Google-Extended 没有独立的 User-Agent 字符串。

字段当前含义(核对日期:2026 年 7 月 22 日)
对象类型控制内容用途的独立产品令牌
请求身份没有独立的 HTTP 用户代理身份
实际抓取由 Google 现有的用户代理完成
控制的用途Google 官方文档列出的 Gemini 训练与采信
Google 搜索不影响普通搜索的收录或排名

Google 的 common crawlers 页面既介绍实际发出请求的爬虫,也介绍面向具体产品的控制令牌,因此 Google-Extended 会列在其中。不能仅凭页面所属目录判断其性质,仍应以 Google 当前爬虫文档 对各字段的明确说明为准。

这种做法在 Robots Exclusion Protocol 中并不常见。按照 RFC 9309 的通常约定,爬虫产品令牌应出现在相应的 HTTP User-Agent 字符串中。Google 则明确将 Google-Extended 用作内容用途控制令牌。因此,应把它视为用途控制令牌,而不是身份未公开的爬虫。

2. 没有独立爬虫,控制规则如何生效

系统会分开处理抓取请求与抓取后的用途判断:

Google 现有用户代理抓取 URL
             │
             ▼
Google 读取该主机的 Google-Extended 规则
             │
       ┌─────┴─────┐
       ▼           ▼
    允许使用      禁止使用
       │           │
       ▼           ▼
用于列出的训练    排除在列出的训练
或采信流程        或采信流程之外

禁止规则不会阻止抓取请求本身。Googlebot 仍可能为搜索而抓取同一 URL,服务器日志也会继续记录 Googlebot,而不是 Google-Extended。规则限制的是抓取后的用途,也就是 Google 能否将内容用于文档列出的流程。

同理,只匹配 Google-Extended 的 WAF 规则也不会生效。这个令牌没有可供匹配的请求字符串、专属 IP 范围,也没有用于核验身份的反向 DNS。网络层决定请求能否获取内容;Google-Extended 决定已获取的内容可以用于什么目的。

常见的训练或检索爬虫会同时声明请求身份和用途,用户触发型代理则代表用户发起访问。Google-Extended 与这两类情况都不同:它只声明允许哪些用途,本身并不发出请求。不同类别的区别见 AI 爬虫。

Applebot-Extended 的工作方式相似:它本身不抓取页面,只控制 Applebot 已抓取数据的用途。不过,两者适用范围不同。Apple 的令牌用于基础模型训练,Google 当前的令牌还涵盖若干实时采信用途。

3. 它控制哪些 Gemini 用途

Google 当前将两类用途归入同一个令牌。因此,只把 Google-Extended 当作训练退出开关已不准确。

用途类别Google 当前列出的产品或功能禁止后的影响
未来模型训练供 Gemini Apps 和 Vertex AI API for Gemini 使用的模型内容不再用于符合条件的训练
Gemini 采信Gemini Apps内容不再作为官方列出的实时采信依据
Google Cloud 产品中的 Google 搜索采信支持此功能的 Google Cloud 产品内容不再用于这类采信
搜索生成式 AI 所用模型的训练用于生成搜索 AI 回答的模型按照 Google 的说明,发布者应使用 Google-Extended 限制这项训练

Google Cloud 的产品名称仍在变化。当前的 Grounding with Google Search 文档 明确说明,Gemini Enterprise Agent Platform 不会把禁止 Google-Extended 的网页作为采信依据。Google 已将较早的 Vertex AI 文档迁移至新的产品目录,因此复核策略时应以当前官方页面为准,不能只看某个固定的产品名称。

这项控制推出时间不长,适用范围却已发生重要变化:

2023-09-28        2026-06-03          2026-07-22
首次发布           搜索 AI 另设控制     当前核对范围
Bard 与 Vertex  →  单独测试 Search →   Gemini 训练与
AI 模型用途        AI 控制              列出的采信用途

发布之初,Google 的说明 是让网站决定其内容能否用于改进 Bard 和 Vertex AI 生成式 API,包括这些产品未来版本的模型。Bard 后来更名为 Gemini,Google 也在使用说明中加入了采信用途。适用产品清单会随相关政策持续更新,不能据此推断 Google-Extended 将永久覆盖 Google 的所有 AI 产品。

这个令牌的适用范围应以 Google 明确列出的用途为准,不能把它理解为覆盖 Google 的全部模型训练、Google Gemini 下的每一种产品,或 Google 对网页内容的所有使用方式。

4. Google 搜索、AI Overviews 与 AI Mode

最常见的误解是,以为禁止 Google-Extended 就能让网站退出 Google AI Overviews 或 AI Mode。它并不决定网站链接和内容能否出现在这些搜索功能中。

Google 当前提供的相关控制分属不同层次:

功能或决策当前控制手段Google-Extended 的作用
普通搜索的抓取与索引Googlebot、robots.txt、noindex 及其他搜索控制不影响收录或排名
搜索摘要及可展示的页面片段nosnippet、max-snippet、data-nosnippet、预览控制不直接参与
搜索生成式 AI 中的展示与采信Search Console 的搜索生成式 AI 控制(如已开放)Google-Extended 不参与,另有独立控制
生成搜索 AI 回答所用模型的训练Google-ExtendedGoogle 指示发布者使用此令牌
官方列出的 Gemini Apps 与 Cloud 采信Google-Extended可直接控制这些用途

页面能否进入这些搜索功能,仍取决于 Googlebot。Google 的 2026 年 7 月 AI 优化指南 说明,页面必须已被索引,并符合显示搜索摘要的条件;若该项独立控制已向相应的 Search Console 资源开放,还须通过该资源允许页面进入搜索生成式 AI 功能。搜索 AI 采用检索增强生成(retrieval-augmented generation,RAG),从 Google 搜索索引中选取页面。

这项独立搜索控制推出不久,尚未全面开放。2026 年 1 月,Google 还在研究如何让网站单独退出搜索生成式 AI 功能;6 月 3 日,Google 开始面向部分英国站长测试 Search Console 开关。截至 7 月 22 日,帮助页仅说明该功能正在向部分站长开放,尚未宣布在全球正式推出。

通过该开关排除某项 Search Console 资源后,其链接和内容将不会出现在 AI Overviews、AI Mode 以及 Discover 的生成式 AI 功能中,也不会成为这些功能的采信依据。网站将失去这些功能带来的展示和流量。Google 表示,这项选择不会成为其他搜索功能的收录或排名信号。

Search Console 帮助页 还明确说明,该开关不控制 AI 训练。如果要限制生成搜索 AI 回答所用模型的训练,Google 仍要求发布者使用 Google-Extended。因此,Google-Extended 不影响搜索排名,却能限制这类模型训练,两者并不矛盾。

5. 如何编写 robots.txt 规则

若要禁止该主机上的所有内容用于 Google-Extended 列出的用途,可在该主机的 robots.txt 中加入具名规则组:

User-agent: Google-Extended
Disallow: /

这不会阻止 Googlebot。如果搜索可见度很重要,应采用上述规则,不要改为禁止 Googlebot。

按路径设置时,可以允许一份公开报告,同时禁止同一目录中的其他内容:

User-agent: Google-Extended
Disallow: /members/
Allow: /members/public-report/

由于公开报告的 Allow 路径更长、更具体,因此会优先匹配;/members/ 下的其余内容仍不得用于 Google 为该令牌列出的用途。

Google 的 robots.txt 解析规则 有几个要点,需要逐项测试:

  • 产品令牌匹配不区分大小写,但 URL 路径可能区分大小写。
  • 针对同一具名令牌的多个规则组会合并。
  • 具名令牌的规则组不会与通配符 * 的规则组合并。
  • 最具体的匹配路径优先;长度相同时,采用限制较少的规则。

实际配置仍建议沿用官方大小写。这样既便于审核,也可避免通用解析器、检查工具或同事将有效但少见的写法误判为拼写错误。

如果没有适用的禁止规则,就表示允许文档列出的用途。空的 Disallow: 并不是退出设置,只用注释说明策略也无法形成机器可读的规则。

robots.txt 按协议、主机和端口分别生效。不能假定 https://example.com/robots.txt 中的规则也适用于 https://docs.example.com、http://example.com 或非默认端口上的服务。协议细节和异常响应见 robots.txt,部署检查见 AI 爬虫访问审计。

6. 无法通过日志识别时,如何验证策略

Google-Extended 不会产生独立的流量标识,因此验证工作应以配置为依据。

可以直接验证无法直接确认不能据此声称
目标 /robots.txt 以纯文本返回 200是否有抓取专门服务于 Google-Extended 所列用途禁止规则会删除此前收集的数据
每种协议、主机和端口均提供预期的规则组与这些用途相关的抓取是否已经停止某个历史模型已经移除这些训练数据
解析器对代表性路径给出预期结果某次请求是否只服务于这一后续用途除非 Google 明确公布,否则不能声称所有产品都遵循统一的生效时限
CDN 与源站返回同一份最新文件Googlebot 继续访问是否意味着配置失败robots.txt 能保护机密内容或强制执行版权限制
Google 对受影响产品的说明没有变化仅凭普通服务器日志辨明 Google 的每一种内部用途Google-Extended 覆盖 Google 未列出的产品

检查时,应分别从源站网络内外发起请求。即使源文件正确,过期的 CDN 缓存、平台自动生成的 robots 文件、不同环境的 URL 处理方式,或错误主机上的重定向,也可能使实际生效的配置难以确认。

至少测试一条允许路径、一条禁止路径及两者的边界。如果存在多个 Google-Extended 规则组,还应测试合并后的结果。应保存实际返回的内容、变更时间、负责人和策略理由。

不要将 Googlebot 抓取量下降视为成功指标。Googlebot 仍服务于搜索,抓取量保持稳定属于正常现象。AI 爬虫访问审计 可以核对配置部署和普通爬虫身份,但日志不会显示独立的 Google-Extended 机器人,因为这个令牌本身并不代表机器人。

还应定期复核官方文档。Google-Extended 发布后,训练与采信范围已经变化;Google Cloud 的产品目录在 2026 年再次调整;独立的搜索 AI 控制也在五个月内从研究阶段进入有限测试。

7. 常见配置错误

错误做法为什么看起来合理实际后果
为拒绝 Gemini 训练而禁止 Googlebot实际抓取由 Googlebot 完成可能损害搜索抓取、索引,以及进入搜索 AI 功能的资格
在日志中搜索 Google-Extended大多数机器人令牌都代表请求身份不会匹配到请求,因为它没有 HTTP 用户代理
把它当作只控制训练的令牌发布之初主要强调训练当前文档还列出了 Gemini Apps 与 Google Cloud 的采信用途
用它退出 AI Overviews 或 AI Mode这些功能也使用 Gemini 模型搜索中的展示与采信由另一项 Search Console 控制决定
认为它与搜索 AI 完全无关它确实不控制搜索收录或排名Google 要求用它限制生成搜索 AI 回答所用模型的训练
把 llms.txt 当作退出设置它可供机器读取,也与 AI 有关Google 搜索会忽略它,它也无法表达是否允许 Google-Extended 所列用途
把 robots.txt 当作安全防护指令名称中有 DisallowRFC 9309 明确说明这些规则不是访问授权
仅更新主域名容易误以为一份文件可以覆盖全站子域名、协议、端口或 CDN 边缘节点可能提供不同策略
认为设置一次便永久有效指令本身不会过期适用产品与搜索控制会变化,静态文件不会自动跟进

代价最大的错误,是为了拒绝官方列出的后续 AI 用途而一并禁止 Googlebot,进而影响普通搜索。如果目标是保留普通搜索,同时拒绝 Google-Extended 控制的用途,就应保持 Googlebot 可抓取,并单独配置 Google-Extended。部署任何「阻止全部 AI」的预设前,都应逐行检查规则。

风险最高的错误,是将 robots.txt 当作安全机制。私有内容、需要授权的内容或仅限客户访问的内容,都必须采用身份验证和访问授权。robots.txt 是一份公开且依赖自愿遵守的文件,无法阻止不合规客户端、伪造的用户代理或普通浏览器访问已公开的 URL。

8. 如何选择访问策略

目前没有哪种设置能在拒绝训练的同时保留 Google-Extended 列出的所有采信机会。选择时必须明确相应取舍。

发布者目标指令或控制对可见度和内容用途的影响
保留普通搜索和搜索 AI 中的展示,拒绝 Google-Extended 列出的用途允许 Googlebot 抓取;禁止 Google-Extended进入普通搜索的资格不受影响,但内容将无法用于符合条件的训练,也会失去官方列出的 Gemini 与 Cloud 产品采信机会
允许官方列出的训练与采信不禁止 Google-Extended内容仍可用于 Google 当前列出的用途
退出 AI Overviews、AI Mode 与 Discover 中的生成式 AI 功能如已开放,使用 Search Console 生成式 AI 控制链接和内容不再出现在这些功能中,也不再被采信,因此会失去展示和流量;这项设置不影响其他搜索功能
完全退出 Google 搜索使用 noindex 等搜索专用控制失去普通搜索可见度;只用 Google-Extended 无法做到
保护非公开或付费内容要求身份验证和访问授权内容不再供公开抓取;robots.txt 只能作为补充声明

真正需要决定的是,是否同时允许训练和采信,而不是设想可以只拒绝训练、不承担其他代价。网站可能不愿让内容进入未来模型训练,却希望作为最新信息来源被 Gemini Apps 或支持 Google 搜索采信的 Cloud 产品引用。目前,这个令牌无法分别表达这两个目标。

是否参与搜索 AI 功能,还要单独决定。发布者可以保留普通搜索,同时通过尚在有限开放阶段的 Search Console 控制退出 AI Overviews 和 AI Mode;代价是失去这些功能可能带来的展示和流量。这项控制不能替代 Google-Extended;若要限制符合条件的模型训练,仍须使用后者。

两项选择都应记录在案,注明预期用途、负责人、涉及的 Search Console 资源与主机、具体指令或控制设置、部署日期和下次复核日期。可通过 AI 爬虫访问审计 留存部署证据,并结合 Google Gemini 与 Google AI Overviews 评估平台影响。

参考资料

Google 产品控制与文档:

协议与对照:

常见问题

Google-Extended 是爬虫吗?
不是。Google 将它定义为控制内容用途的独立产品令牌。它没有单独的 HTTP 用户代理字符串,实际抓取仍由 Google 现有的用户代理完成。应把它理解为一项针对已抓取内容的用途规则,而不是能在服务器日志中识别的机器人。
禁止 Google-Extended 会影响 Google 搜索排名吗?
不会。Google 明确表示,Google-Extended 不影响网站能否进入 Google 搜索,也不是搜索排名信号。如果搜索可见度很重要,应继续允许 Googlebot。禁止 Google-Extended 影响的是已抓取内容能否用于官方列出的 AI 用途,并不影响普通搜索抓取。
Google-Extended 能让网站退出 AI Overviews 或 AI Mode 吗?
不能。它既不能阻止网站链接和内容出现在这些功能中,也不能阻止内容成为回答的采信依据。Google 正在测试另一项 Search Console 生成式 AI 控制,适用于 AI Overviews、AI Mode 和 Discover 中的生成式 AI 功能。Google-Extended 与这些搜索功能相关的作用,则限于控制符合条件的模型训练,包括生成搜索 AI 回答所用模型的训练。
服务器日志能证明 Google-Extended 规则已经生效吗?
不能。Google-Extended 不会以独立身份发出请求,因此日志中看不到相应的身份变化。应核对 robots.txt 文件、主机范围、规则组的解析结果、缓存状态和 Google 当前文档。Googlebot 继续访问属于正常现象,并不表示规则失效。
我能禁止 Gemini 训练,同时保留 Google-Extended 涵盖的全部采信用途吗?
目前 Google 没有为训练和采信设置相互独立的 Google-Extended 指令,同一个令牌覆盖文档列出的两类用途。禁止它不仅会限制训练,还会失去 Gemini Apps 和部分 Google Cloud 产品中符合条件的采信机会。

延伸阅读

参考来源

一手来源

  1. Google's common crawlers · Google Crawling Infrastructure · 2026-07-14
  2. Search generative AI control · Google Search Console Help
  3. Optimizing your website for generative AI features on Google Search · Google Search Central · 2026-07-10
  4. Grounding with Google Search · Google Cloud · 2026-07-21
  5. An update on web publisher controls · Google · 2023-09-28
  6. Our approach to website controls for Search AI features · Google · 2026-01-28
  7. New opportunities, control and insights for website owners · Google · 2026-06-03
  8. How Google interprets the robots.txt specification · Google Crawling Infrastructure · 2026-07-08
  9. RFC 9309: Robots Exclusion Protocol · IETF
  10. About Applebot · Apple · 2026-06-08
最近更新: 2026-07-22 作者: Ray Yang 主题: 基础设施