Google-Extended
速览要点
- 它是什么
- 一个独立的 robots.txt 产品令牌,用来管控 Google 所抓取内容的若干后续用途
- HTTP 用户代理
- 没有。请求仍由 Google 现有的用户代理发出,因此日志中不会出现独立的 Google-Extended 标识
- 它管控什么
- Google 列明的未来 Gemini 模型训练,以及 Gemini Apps 和部分 Google Cloud 产品内的 Google 搜索采信
- 对 Google 搜索的影响
- 不影响普通搜索的收录或排名;搜索 AI 中的展示与采信另有一项正在向部分站长推出的 Search Console 控制
- 主要取舍
- 同一条禁止规则既会拒绝符合条件的训练,也会放弃列明的实时采信机会;Google 没有为这两类用途提供独立开关
Google-Extended 应理解为 robots.txt 中控制内容后续用途的开关,而不是以自身名义访问网站的 AI 爬虫。
1. Google-Extended 是什么
Google-Extended 是一个可写入 robots.txt User-agent: 字段的独立产品令牌(product token)。Google 依据相应规则,决定现有爬虫抓取的内容能否用于列明的 Gemini 训练或采信(grounding)流程(见 Google’s common crawlers)。
这里有两个概念不能混为一谈。这个令牌使用 robots.txt 的语法,但并不代表一个 HTTP 客户端。Google 明确说明,Google-Extended 没有独立的 User-Agent 字符串。
| 字段 | 当前含义(核对日期:2026 年 7 月 22 日) |
|---|---|
| 对象类型 | 控制内容用途的独立产品令牌 |
| 请求身份 | 没有独立身份 |
| 实际抓取 | Google 现有的用户代理 |
| 管控用途 | 文档列明的 Gemini 训练与采信 |
| Google 搜索 | 不影响普通搜索的收录或排名 |
Google 把它列在 common crawlers 页面,是因为该页面既收录实际发出请求的爬虫,也收录面向具体产品的控制令牌。不能仅凭页面所属目录判断其性质,仍应以 Google 当前爬虫文档 对各字段的明确说明为准。
这种做法在 Robots Exclusion Protocol 中并不常见。RFC 9309 通常预期爬虫的产品令牌可在其 HTTP User-Agent 中找到。Google 则明确将 Google-Extended 用作内容用途控制令牌。因此,更准确的理解是策略令牌,而不是隐藏的爬虫。
2. 没有独立爬虫的控制令牌如何生效
实际抓取与抓取后的用途判断发生在不同环节:
Google 现有用户代理抓取 URL
│
▼
Google 读取该主机的 Google-Extended 规则
│
┌─────┴─────┐
▼ ▼
允许使用 禁止使用
│ │
▼ ▼
进入列明的训练 从这些列明的训练
或采信流程 或采信流程中排除
禁止规则不会阻止最初的请求。Googlebot 仍可能为搜索而抓取同一 URL,服务器日志也会继续记录 Googlebot,而不是 Google-Extended。规则改变的是抓取后的用途,即 Google 能否将内容用于文档列明的流程。
同理,只匹配 Google-Extended 的 WAF 规则也不会生效。这个令牌没有可供匹配的请求字符串、专属 IP 范围或用于核验身份的反向 DNS。网络层决定请求能否获取内容;Google-Extended 决定已获取的内容可作何用途。
常见的训练或检索爬虫会同时声明请求身份和用途,用户触发型代理则代表用户发起访问。Google-Extended 不属于这些典型情况:它只表达用途权限,本身并不发出请求。不同类别的区别见 AI 爬虫。
Applebot-Extended 采用相似的分工:它本身不抓取页面,而是控制 Applebot 已抓取数据的用途。不过,两者适用范围不同。Apple 的令牌用于基础模型训练,Google 当前的令牌还涵盖若干实时采信用途。
3. 它管控哪些 Gemini 用途
Google 当前将两类用途归入同一个令牌。因此,仅将 Google-Extended 称为“训练退出开关”已不准确。
| 管控类别 | Google 当前列明的产品或功能 | 禁止后的含义 |
|---|---|---|
| 未来模型训练 | 为 Gemini Apps 和 Vertex AI API for Gemini 提供能力的模型 | 内容不再用于符合条件的训练 |
| Gemini 采信 | Gemini Apps | 内容不再用于列明的实时采信 |
| Google Cloud 上的 Google 搜索采信 | 支持此功能的 Google Cloud 产品 | 内容不再用于这项采信流程 |
| 搜索生成式 AI 模型训练 | 用于生成搜索 AI 回答的模型 | Google 指示发布者用 Google-Extended 限制这项训练 |
Google Cloud 的产品名称仍在变化。当前的 Grounding with Google Search 文档 明确说明,Gemini Enterprise Agent Platform 不会采用已禁止 Google-Extended 的网页作为采信依据。Google 已将较早的 Vertex AI 文档迁移至新的产品目录,因此复核策略时应以当前官方页面为准,不应仅依据某个固定的产品名称。
这项控制推出时间不长,适用范围却已发生重要变化:
2023-09-28 2026-06-03 2026-07-22
首次发布 搜索控制拆分 当前核对范围
Bard + Vertex → 单独测试 Search → Gemini 训练 +
AI 模型用途 AI 控制 列明的采信用途
发布之初,Google 的说明 是让网站决定其内容能否用于改进 Bard 和 Vertex AI 生成式 API,包括这些产品未来版本的模型。Bard 后来更名为 Gemini,Google 也在操作说明中加入了采信用途。受影响产品清单会随厂商政策持续更新,不能由此推断该令牌会永久涵盖 Google 的所有 AI 产品。
这个令牌的适用范围应以 Google 明列的用途为准,不能扩大为“Google 的全部模型训练”,也不能延伸至 Google Gemini 下的每一种产品,或 Google 使用网页内容的所有方式。
4. Google 搜索、AI Overviews 与 AI Mode
最常见的误解,是以为禁止 Google-Extended 就能让网站退出 Google AI Overviews 或 AI Mode。它并不决定网站链接和内容能否出现在这些搜索功能中。
Google 当前提供的相关控制分属不同层次:
| 功能或决策 | 当前控制手段 | Google-Extended 的作用 |
|---|---|---|
| 普通搜索的抓取与索引 | Googlebot、robots.txt、noindex 及其他搜索控制 | 不影响收录或排名 |
| 搜索摘要及可展示的页面片段 | nosnippet、max-snippet、data-nosnippet、预览控制 | 不直接参与 |
| 搜索生成式 AI 中的展示与采信 | Search Console 的搜索生成式 AI 控制(如已开放) | 另有独立控制 |
| 生成搜索 AI 回答所用模型的训练 | Google-Extended | Google 指示发布者使用此令牌 |
| 列明的 Gemini Apps 与 Cloud 采信 | Google-Extended | 直接管控 |
页面能否进入搜索功能,仍取决于 Googlebot。Google 的 2026 年 7 月 AI 优化指南 说明,页面必须已被索引,并符合在搜索中显示摘要的条件;如果独立控制已开放,相应 Search Console 资源还必须允许页面进入搜索生成式 AI 功能。搜索 AI 采用检索增强生成(retrieval-augmented generation,RAG),从 Google 搜索索引中选取页面。
这项独立搜索控制推出不久,尚未全面开放。2026 年 1 月,Google 还在研究单独退出搜索生成式 AI 功能的控制;6 月 3 日,Google 开始面向部分英国站长测试 Search Console 开关。截至 7 月 22 日,帮助页仅说明该功能正在向部分站长推出,尚未宣布在全球正式开放。
通过该开关排除某个 Search Console 资源后,其链接和内容不会出现在 AI Overviews、AI Mode 以及 Discover 的生成式 AI 功能中,也不会成为这些功能的采信依据。网站将失去来自这些功能的展示和流量。Google 表示,这项选择不会成为搜索其他部分的收录或排名信号。
Search Console 帮助页 还明确了另一项边界:该开关不控制 AI 训练。如果要限制生成搜索 AI 回答所用模型的训练,Google 仍要求发布者使用 Google-Extended。因此,“Google-Extended 不影响搜索排名”和“它能限制搜索 AI 背后符合条件的模型训练”并不矛盾。
5. 如何编写 robots.txt 规则
如果要在整个主机范围内禁止 Google 为 Google-Extended 列明的用途,可在该主机的 robots.txt 中加入具名规则组:
User-agent: Google-Extended
Disallow: /
这不会阻止 Googlebot。如果搜索可见度很重要,不要用禁止 Googlebot 来替代上述规则。
按路径设置时,可以允许一份公开报告,同时禁止同一目录中的其他内容:
User-agent: Google-Extended
Disallow: /members/
Allow: /members/public-report/
对公开报告而言,更长、更具体的 Allow 路径优先;/members/ 下的其余内容仍不得用于 Google 为该令牌列明的用途。
Google 对 robots.txt 的解析规则 有几个要点,需要逐项测试:
- 产品令牌匹配不区分大小写,但 URL 路径可能区分大小写。
- 多个匹配同一特定令牌的规则组会合并。
- 具名令牌组不会与通配符
*组合并。 - 最具体的匹配路径优先;长度相同时,采用限制较少的规则。
实际配置仍建议采用官方大小写。这样既便于审核,也可避免通用解析器、检查工具或同事将有效但少见的写法误判为拼写错误。
如果没有适用的禁止规则,就表示允许文档列明的用途。空的 Disallow: 并非退出设置,仅用注释表达策略也无法形成机器可读的规则。
robots.txt 按协议、主机和端口分别生效。不能假定 https://example.com/robots.txt 中的规则也适用于 https://docs.example.com、http://example.com 或非默认端口上的服务。协议细节和异常响应见 robots.txt,部署检查见 AI 爬虫访问审计。
6. 没有日志标识时如何验证策略
Google-Extended 不会产生独立的流量标识,因此验证工作应以配置为依据。
| 可以验证 | 无法直接验证 | 不应声称 |
|---|---|---|
目标 /robots.txt 以纯文本返回 200 | Google-Extended 是否曾经访问 | 禁止规则删除了此前收集的数据 |
| 每种协议、主机和端口都提供预期规则组 | Google-Extended 流量已经停止 | 某个历史模型已经移除这些训练数据 |
| 解析器对代表性路径给出预期结果 | 某次请求只服务于这一后续用途 | 厂商承诺了全产品统一的生效时限,除非 Google 明确公布 |
| CDN 与源站返回同一份最新文件 | Googlebot 继续访问代表配置失败 | robots.txt 能保护机密内容或执行版权限制 |
| Google 对受影响产品的说明没有变化 | 仅凭普通服务器日志辨明 Google 的每一种内部用途 | 该令牌覆盖 Google 未列明的产品 |
检查时,应分别从源站网络内外发起请求。即使源文件正确,过期的 CDN 缓存、平台自动生成的 robots 文件、不同环境的 URL 处理方式,或错误主机上的重定向也可能遮盖实际配置。
至少测试一条允许路径、一条禁止路径及两者的边界。如果存在多个 Google-Extended 规则组,还应测试合并后的结果。应保存实际返回的内容、变更时间、负责人和策略理由。
不要将 Googlebot 抓取量下降视为成功指标。Googlebot 仍服务于搜索,抓取量保持稳定属于正常现象。AI 爬虫访问审计 可以核对配置部署和普通爬虫身份,但日志无法显示独立的 Google-Extended 机器人,因为它并不存在。
还应定期复核官方文档。Google-Extended 发布后,训练与采信范围已经变化;Google Cloud 的产品目录在 2026 年再次调整;独立的搜索 AI 控制也在五个月内从研究阶段进入有限测试。
7. 常见误配
| 误配 | 为什么看起来合理 | 实际后果 |
|---|---|---|
为拒绝 Gemini 训练而禁止 Googlebot | 实际抓取由 Googlebot 完成 | 可能损害搜索抓取、索引和搜索 AI 资格 |
在日志中搜索 Google-Extended | 大多数机器人令牌都代表请求身份 | 不会匹配到请求,因为它没有 HTTP 用户代理 |
| 把它当作仅管训练的令牌 | 发布之初主要强调训练 | 当前文档还列明 Gemini Apps 与 Google Cloud 的采信用途 |
| 用它退出 AI Overviews 或 AI Mode | 这些功能也使用 Gemini 模型 | 搜索中的展示与采信由独立的 Search Console 控制管理 |
| 认为它与搜索 AI 完全无关 | 它确实不控制搜索收录或排名 | Google 要求用它限制生成搜索 AI 回答所用模型的训练 |
| 把 llms.txt 当作退出设置 | 它可供机器读取,也与 AI 有关 | Google 搜索会忽略它,它也无法表达 Google-Extended 权限 |
| 把 robots.txt 当作安全防护 | 指令名称中有 Disallow | RFC 9309 明确说明这些规则不是访问授权 |
| 仅更新主域名 | 一份文件看起来像是全站通用 | 子域名、协议、端口或缓存边缘可能提供不同策略 |
| 认为设置一次便永久有效 | 指令本身不会过期 | 产品范围与搜索控制会变化,静态文件不会自动跟进 |
代价最大的错误,是为了拒绝列明的后续 AI 用途而一并禁止普通搜索。如果目标是保留普通搜索,同时拒绝 Google-Extended 管控的用途,就应保持 Googlebot 可抓取,并单独配置 Google-Extended。部署任何“阻止全部 AI”的预设前,都应逐行检查规则。
风险最高的错误,是将 robots.txt 当作安全机制。私有、需要授权或仅限客户访问的内容必须采用身份验证和访问授权。robots.txt 是一份公开且依赖自愿遵守的文件,无法阻止不合规客户端、伪造的用户代理或普通浏览器访问已公开的 URL。
8. 如何选择访问策略
目前不存在一种没有代价的设置,可以在拒绝训练的同时保留 Google-Extended 列明的所有采信机会。选择时必须明确相应取舍。
| 发布者目标 | 指令或控制 | 可见度与用途代价 |
|---|---|---|
| 保留搜索和搜索 AI 展示,拒绝 Google-Extended 列明的用途 | 保持 Googlebot 可访问;禁止 Google-Extended | 普通搜索资格不受影响,但会失去符合条件的训练与列明的 Gemini、Cloud 采信 |
| 允许列明的训练与采信 | 不禁止 Google-Extended | 内容仍有资格进入 Google 当前列明的用途 |
| 退出 AI Overviews、AI Mode 与 Discover AI | 如已开放,使用 Search Console 生成式 AI 控制 | 失去这些功能中的链接、采信、展示和流量;其他搜索功能不受这项设置管控 |
| 完全退出 Google 搜索 | 使用 noindex 等搜索专用控制 | 失去普通搜索可见度;只用 Google-Extended 无法做到 |
| 保护非公开或付费内容 | 要求身份验证和访问授权 | 内容不再公开可抓取;robots.txt 只能作为补充声明 |
业务上需要决定的是,是否同时允许训练和采信,而不是设想“仅拒绝训练且没有其他代价”。网站可能不愿让内容进入未来模型训练,却希望作为最新信息来源被 Gemini Apps 或支持 Google 搜索采信的 Cloud 产品引用。目前,这个令牌无法分别表达这两个目标。
搜索 AI 还需单独决策。发布者可以保留普通搜索,同时通过仍在有限推出的 Search Console 控制退出 AI Overviews 和 AI Mode;代价是失去这些功能可能带来的流量与展示。这项控制不能取代 Google-Extended 对符合条件模型训练的限制。
两项选择都应形成正式记录,包括预期用途、负责人、涉及的 Search Console 资源与主机、具体指令或控制设置、部署日期和下次复核日期。实施证据可通过 AI 爬虫访问审计 留存,并结合 Google Gemini 与 Google AI Overviews 评估平台影响。
参考资料
Google 产品控制与文档:
- Google Crawling Infrastructure — Google’s common crawlers
- Google Search Console Help — Search generative AI control
- Google Search Central — Optimizing your website for generative AI features on Google Search
- Google Cloud — Grounding with Google Search
- Google — An update on web publisher controls
- Google — Our approach to website controls for Search AI features
- Google — New opportunities, control and insights for website owners
协议与对照:
- Google Crawling Infrastructure — How Google interprets the robots.txt specification
- IETF — RFC 9309: Robots Exclusion Protocol
- Apple — About Applebot
常见问题
Google-Extended 是爬虫吗?
禁止 Google-Extended 会影响 Google 搜索排名吗?
Google-Extended 能让网站退出 AI Overviews 或 AI Mode 吗?
服务器日志能证明 Google-Extended 规则已经生效吗?
我能禁止 Gemini 训练,同时保留 Google-Extended 管控的全部采信用途吗?
延伸阅读
参考来源
一手来源
- Google's common crawlers · Google Crawling Infrastructure · 2026-07-14
- Search generative AI control · Google Search Console Help
- Optimizing your website for generative AI features on Google Search · Google Search Central · 2026-07-10
- Grounding with Google Search · Google Cloud · 2026-07-21
- An update on web publisher controls · Google · 2023-09-28
- Our approach to website controls for Search AI features · Google · 2026-01-28
- New opportunities, control and insights for website owners · Google · 2026-06-03
- How Google interprets the robots.txt specification · Google Crawling Infrastructure · 2026-07-08
- RFC 9309: Robots Exclusion Protocol · IETF
- About Applebot · Apple · 2026-06-08