跳到正文

Google-Extended

速览要点

它是什么
一个独立的 robots.txt 产品令牌,用来管控 Google 所抓取内容的若干后续用途
HTTP 用户代理
没有。请求仍由 Google 现有的用户代理发出,因此日志中不会出现独立的 Google-Extended 标识
它管控什么
Google 列明的未来 Gemini 模型训练,以及 Gemini Apps 和部分 Google Cloud 产品内的 Google 搜索采信
对 Google 搜索的影响
不影响普通搜索的收录或排名;搜索 AI 中的展示与采信另有一项正在向部分站长推出的 Search Console 控制
主要取舍
同一条禁止规则既会拒绝符合条件的训练,也会放弃列明的实时采信机会;Google 没有为这两类用途提供独立开关

Google-Extended 应理解为 robots.txt 中控制内容后续用途的开关,而不是以自身名义访问网站的 AI 爬虫

1. Google-Extended 是什么

Google-Extended 是一个可写入 robots.txt User-agent: 字段的独立产品令牌(product token)。Google 依据相应规则,决定现有爬虫抓取的内容能否用于列明的 Gemini 训练或采信(grounding)流程(见 Google’s common crawlers)。

这里有两个概念不能混为一谈。这个令牌使用 robots.txt 的语法,但并不代表一个 HTTP 客户端。Google 明确说明,Google-Extended 没有独立的 User-Agent 字符串。

字段当前含义(核对日期:2026 年 7 月 22 日)
对象类型控制内容用途的独立产品令牌
请求身份没有独立身份
实际抓取Google 现有的用户代理
管控用途文档列明的 Gemini 训练与采信
Google 搜索不影响普通搜索的收录或排名

Google 把它列在 common crawlers 页面,是因为该页面既收录实际发出请求的爬虫,也收录面向具体产品的控制令牌。不能仅凭页面所属目录判断其性质,仍应以 Google 当前爬虫文档 对各字段的明确说明为准。

这种做法在 Robots Exclusion Protocol 中并不常见。RFC 9309 通常预期爬虫的产品令牌可在其 HTTP User-Agent 中找到。Google 则明确将 Google-Extended 用作内容用途控制令牌。因此,更准确的理解是策略令牌,而不是隐藏的爬虫。

2. 没有独立爬虫的控制令牌如何生效

实际抓取与抓取后的用途判断发生在不同环节:

Google 现有用户代理抓取 URL


Google 读取该主机的 Google-Extended 规则

       ┌─────┴─────┐
       ▼           ▼
    允许使用      禁止使用
       │           │
       ▼           ▼
进入列明的训练    从这些列明的训练
或采信流程        或采信流程中排除

禁止规则不会阻止最初的请求。Googlebot 仍可能为搜索而抓取同一 URL,服务器日志也会继续记录 Googlebot,而不是 Google-Extended。规则改变的是抓取后的用途,即 Google 能否将内容用于文档列明的流程。

同理,只匹配 Google-Extended 的 WAF 规则也不会生效。这个令牌没有可供匹配的请求字符串、专属 IP 范围或用于核验身份的反向 DNS。网络层决定请求能否获取内容;Google-Extended 决定已获取的内容可作何用途。

常见的训练或检索爬虫会同时声明请求身份和用途,用户触发型代理则代表用户发起访问。Google-Extended 不属于这些典型情况:它只表达用途权限,本身并不发出请求。不同类别的区别见 AI 爬虫

Applebot-Extended 采用相似的分工:它本身不抓取页面,而是控制 Applebot 已抓取数据的用途。不过,两者适用范围不同。Apple 的令牌用于基础模型训练,Google 当前的令牌还涵盖若干实时采信用途。

3. 它管控哪些 Gemini 用途

Google 当前将两类用途归入同一个令牌。因此,仅将 Google-Extended 称为“训练退出开关”已不准确。

管控类别Google 当前列明的产品或功能禁止后的含义
未来模型训练为 Gemini Apps 和 Vertex AI API for Gemini 提供能力的模型内容不再用于符合条件的训练
Gemini 采信Gemini Apps内容不再用于列明的实时采信
Google Cloud 上的 Google 搜索采信支持此功能的 Google Cloud 产品内容不再用于这项采信流程
搜索生成式 AI 模型训练用于生成搜索 AI 回答的模型Google 指示发布者用 Google-Extended 限制这项训练

Google Cloud 的产品名称仍在变化。当前的 Grounding with Google Search 文档 明确说明,Gemini Enterprise Agent Platform 不会采用已禁止 Google-Extended 的网页作为采信依据。Google 已将较早的 Vertex AI 文档迁移至新的产品目录,因此复核策略时应以当前官方页面为准,不应仅依据某个固定的产品名称。

这项控制推出时间不长,适用范围却已发生重要变化:

2023-09-28        2026-06-03          2026-07-22
首次发布           搜索控制拆分         当前核对范围
Bard + Vertex  →  单独测试 Search →   Gemini 训练 +
AI 模型用途        AI 控制              列明的采信用途

发布之初,Google 的说明 是让网站决定其内容能否用于改进 Bard 和 Vertex AI 生成式 API,包括这些产品未来版本的模型。Bard 后来更名为 Gemini,Google 也在操作说明中加入了采信用途。受影响产品清单会随厂商政策持续更新,不能由此推断该令牌会永久涵盖 Google 的所有 AI 产品。

这个令牌的适用范围应以 Google 明列的用途为准,不能扩大为“Google 的全部模型训练”,也不能延伸至 Google Gemini 下的每一种产品,或 Google 使用网页内容的所有方式。

4. Google 搜索、AI Overviews 与 AI Mode

最常见的误解,是以为禁止 Google-Extended 就能让网站退出 Google AI Overviews 或 AI Mode。它并不决定网站链接和内容能否出现在这些搜索功能中。

Google 当前提供的相关控制分属不同层次:

功能或决策当前控制手段Google-Extended 的作用
普通搜索的抓取与索引Googlebot、robots.txt、noindex 及其他搜索控制不影响收录或排名
搜索摘要及可展示的页面片段nosnippetmax-snippetdata-nosnippet、预览控制不直接参与
搜索生成式 AI 中的展示与采信Search Console 的搜索生成式 AI 控制(如已开放)另有独立控制
生成搜索 AI 回答所用模型的训练Google-ExtendedGoogle 指示发布者使用此令牌
列明的 Gemini Apps 与 Cloud 采信Google-Extended直接管控

页面能否进入搜索功能,仍取决于 Googlebot。Google 的 2026 年 7 月 AI 优化指南 说明,页面必须已被索引,并符合在搜索中显示摘要的条件;如果独立控制已开放,相应 Search Console 资源还必须允许页面进入搜索生成式 AI 功能。搜索 AI 采用检索增强生成(retrieval-augmented generation,RAG),从 Google 搜索索引中选取页面。

这项独立搜索控制推出不久,尚未全面开放。2026 年 1 月,Google 还在研究单独退出搜索生成式 AI 功能的控制;6 月 3 日,Google 开始面向部分英国站长测试 Search Console 开关。截至 7 月 22 日,帮助页仅说明该功能正在向部分站长推出,尚未宣布在全球正式开放。

通过该开关排除某个 Search Console 资源后,其链接和内容不会出现在 AI Overviews、AI Mode 以及 Discover 的生成式 AI 功能中,也不会成为这些功能的采信依据。网站将失去来自这些功能的展示和流量。Google 表示,这项选择不会成为搜索其他部分的收录或排名信号。

Search Console 帮助页 还明确了另一项边界:该开关不控制 AI 训练。如果要限制生成搜索 AI 回答所用模型的训练,Google 仍要求发布者使用 Google-Extended。因此,“Google-Extended 不影响搜索排名”和“它能限制搜索 AI 背后符合条件的模型训练”并不矛盾。

5. 如何编写 robots.txt 规则

如果要在整个主机范围内禁止 Google 为 Google-Extended 列明的用途,可在该主机的 robots.txt 中加入具名规则组:

User-agent: Google-Extended
Disallow: /

这不会阻止 Googlebot。如果搜索可见度很重要,不要用禁止 Googlebot 来替代上述规则。

按路径设置时,可以允许一份公开报告,同时禁止同一目录中的其他内容:

User-agent: Google-Extended
Disallow: /members/
Allow: /members/public-report/

对公开报告而言,更长、更具体的 Allow 路径优先;/members/ 下的其余内容仍不得用于 Google 为该令牌列明的用途。

Google 对 robots.txt 的解析规则 有几个要点,需要逐项测试:

  • 产品令牌匹配不区分大小写,但 URL 路径可能区分大小写。
  • 多个匹配同一特定令牌的规则组会合并。
  • 具名令牌组不会与通配符 * 组合并。
  • 最具体的匹配路径优先;长度相同时,采用限制较少的规则。

实际配置仍建议采用官方大小写。这样既便于审核,也可避免通用解析器、检查工具或同事将有效但少见的写法误判为拼写错误。

如果没有适用的禁止规则,就表示允许文档列明的用途。空的 Disallow: 并非退出设置,仅用注释表达策略也无法形成机器可读的规则。

robots.txt 按协议、主机和端口分别生效。不能假定 https://example.com/robots.txt 中的规则也适用于 https://docs.example.comhttp://example.com 或非默认端口上的服务。协议细节和异常响应见 robots.txt,部署检查见 AI 爬虫访问审计

6. 没有日志标识时如何验证策略

Google-Extended 不会产生独立的流量标识,因此验证工作应以配置为依据。

可以验证无法直接验证不应声称
目标 /robots.txt 以纯文本返回 200Google-Extended 是否曾经访问禁止规则删除了此前收集的数据
每种协议、主机和端口都提供预期规则组Google-Extended 流量已经停止某个历史模型已经移除这些训练数据
解析器对代表性路径给出预期结果某次请求只服务于这一后续用途厂商承诺了全产品统一的生效时限,除非 Google 明确公布
CDN 与源站返回同一份最新文件Googlebot 继续访问代表配置失败robots.txt 能保护机密内容或执行版权限制
Google 对受影响产品的说明没有变化仅凭普通服务器日志辨明 Google 的每一种内部用途该令牌覆盖 Google 未列明的产品

检查时,应分别从源站网络内外发起请求。即使源文件正确,过期的 CDN 缓存、平台自动生成的 robots 文件、不同环境的 URL 处理方式,或错误主机上的重定向也可能遮盖实际配置。

至少测试一条允许路径、一条禁止路径及两者的边界。如果存在多个 Google-Extended 规则组,还应测试合并后的结果。应保存实际返回的内容、变更时间、负责人和策略理由。

不要将 Googlebot 抓取量下降视为成功指标。Googlebot 仍服务于搜索,抓取量保持稳定属于正常现象。AI 爬虫访问审计 可以核对配置部署和普通爬虫身份,但日志无法显示独立的 Google-Extended 机器人,因为它并不存在。

还应定期复核官方文档。Google-Extended 发布后,训练与采信范围已经变化;Google Cloud 的产品目录在 2026 年再次调整;独立的搜索 AI 控制也在五个月内从研究阶段进入有限测试。

7. 常见误配

误配为什么看起来合理实际后果
为拒绝 Gemini 训练而禁止 Googlebot实际抓取由 Googlebot 完成可能损害搜索抓取、索引和搜索 AI 资格
在日志中搜索 Google-Extended大多数机器人令牌都代表请求身份不会匹配到请求,因为它没有 HTTP 用户代理
把它当作仅管训练的令牌发布之初主要强调训练当前文档还列明 Gemini Apps 与 Google Cloud 的采信用途
用它退出 AI Overviews 或 AI Mode这些功能也使用 Gemini 模型搜索中的展示与采信由独立的 Search Console 控制管理
认为它与搜索 AI 完全无关它确实不控制搜索收录或排名Google 要求用它限制生成搜索 AI 回答所用模型的训练
llms.txt 当作退出设置它可供机器读取,也与 AI 有关Google 搜索会忽略它,它也无法表达 Google-Extended 权限
把 robots.txt 当作安全防护指令名称中有 DisallowRFC 9309 明确说明这些规则不是访问授权
仅更新主域名一份文件看起来像是全站通用子域名、协议、端口或缓存边缘可能提供不同策略
认为设置一次便永久有效指令本身不会过期产品范围与搜索控制会变化,静态文件不会自动跟进

代价最大的错误,是为了拒绝列明的后续 AI 用途而一并禁止普通搜索。如果目标是保留普通搜索,同时拒绝 Google-Extended 管控的用途,就应保持 Googlebot 可抓取,并单独配置 Google-Extended。部署任何“阻止全部 AI”的预设前,都应逐行检查规则。

风险最高的错误,是将 robots.txt 当作安全机制。私有、需要授权或仅限客户访问的内容必须采用身份验证和访问授权。robots.txt 是一份公开且依赖自愿遵守的文件,无法阻止不合规客户端、伪造的用户代理或普通浏览器访问已公开的 URL。

8. 如何选择访问策略

目前不存在一种没有代价的设置,可以在拒绝训练的同时保留 Google-Extended 列明的所有采信机会。选择时必须明确相应取舍。

发布者目标指令或控制可见度与用途代价
保留搜索和搜索 AI 展示,拒绝 Google-Extended 列明的用途保持 Googlebot 可访问;禁止 Google-Extended普通搜索资格不受影响,但会失去符合条件的训练与列明的 Gemini、Cloud 采信
允许列明的训练与采信不禁止 Google-Extended内容仍有资格进入 Google 当前列明的用途
退出 AI Overviews、AI Mode 与 Discover AI如已开放,使用 Search Console 生成式 AI 控制失去这些功能中的链接、采信、展示和流量;其他搜索功能不受这项设置管控
完全退出 Google 搜索使用 noindex 等搜索专用控制失去普通搜索可见度;只用 Google-Extended 无法做到
保护非公开或付费内容要求身份验证和访问授权内容不再公开可抓取;robots.txt 只能作为补充声明

业务上需要决定的是,是否同时允许训练和采信,而不是设想“仅拒绝训练且没有其他代价”。网站可能不愿让内容进入未来模型训练,却希望作为最新信息来源被 Gemini Apps 或支持 Google 搜索采信的 Cloud 产品引用。目前,这个令牌无法分别表达这两个目标。

搜索 AI 还需单独决策。发布者可以保留普通搜索,同时通过仍在有限推出的 Search Console 控制退出 AI Overviews 和 AI Mode;代价是失去这些功能可能带来的流量与展示。这项控制不能取代 Google-Extended 对符合条件模型训练的限制。

两项选择都应形成正式记录,包括预期用途、负责人、涉及的 Search Console 资源与主机、具体指令或控制设置、部署日期和下次复核日期。实施证据可通过 AI 爬虫访问审计 留存,并结合 Google GeminiGoogle AI Overviews 评估平台影响。

参考资料

Google 产品控制与文档:

协议与对照:

常见问题

Google-Extended 是爬虫吗?
不是。Google 将它定义为控制内容用途的独立产品令牌。它没有单独的 HTTP User-Agent 字符串,实际抓取仍由 Google 现有的用户代理完成。应把它理解为一项抓取后用途声明,而不是能在服务器日志中识别的机器人。
禁止 Google-Extended 会影响 Google 搜索排名吗?
不会。Google 明确表示,Google-Extended 不影响网站能否进入 Google 搜索,也不是搜索排名信号。如果搜索可见度很重要,应继续允许 Googlebot。禁止 Google-Extended 改变的是已抓取内容能否用于列明的 AI 用途,不是普通搜索抓取。
Google-Extended 能让网站退出 AI Overviews 或 AI Mode 吗?
它不能阻止网站在这些功能中展示,也不能阻止内容成为回答的采信依据。Google 正在测试另一项 Search Console 生成式 AI 控制,适用于 AI Overviews、AI Mode 和 Discover 中的生成式 AI 功能。Google-Extended 单独限制符合条件的模型训练,包括生成搜索 AI 回答所用模型的训练。
服务器日志能证明 Google-Extended 规则已经生效吗?
不能。Google-Extended 没有会出现或消失的独立请求身份。应核对 robots.txt 文件、主机范围、规则组的解析结果、缓存状态和 Google 当前文档。Googlebot 继续访问属于正常现象,并不表示规则失效。
我能禁止 Gemini 训练,同时保留 Google-Extended 管控的全部采信用途吗?
目前 Google 没有为训练和采信分别提供不同的 Google-Extended 指令,同一个令牌覆盖文档列出的两类用途。禁止它时,除了限制训练,还应预期失去 Gemini Apps 和部分 Google Cloud 产品中符合条件的采信机会。

延伸阅读

参考来源

一手来源

  1. Google's common crawlers · Google Crawling Infrastructure · 2026-07-14
  2. Search generative AI control · Google Search Console Help
  3. Optimizing your website for generative AI features on Google Search · Google Search Central · 2026-07-10
  4. Grounding with Google Search · Google Cloud · 2026-07-21
  5. An update on web publisher controls · Google · 2023-09-28
  6. Our approach to website controls for Search AI features · Google · 2026-01-28
  7. New opportunities, control and insights for website owners · Google · 2026-06-03
  8. How Google interprets the robots.txt specification · Google Crawling Infrastructure · 2026-07-08
  9. RFC 9309: Robots Exclusion Protocol · IETF
  10. About Applebot · Apple · 2026-06-08
最近更新: 2026-07-22 作者: ray 主题: 基础设施