Google-Extended
速览要点
- 它是什么
- robots.txt 中的一项独立产品令牌,用来决定 Google 抓取的内容能否用于官方列出的后续用途
- HTTP 用户代理
- 不存在。请求仍由 Google 现有的用户代理发出,因此日志中不会出现独立的 Google-Extended 标识
- 它控制哪些用途
- Google 官方列出的未来 Gemini 模型训练,以及 Gemini Apps 和部分 Google Cloud 产品中的 Google 搜索采信
- 对 Google 搜索的影响
- 不影响普通搜索的收录或排名;搜索 AI 中的展示与采信由另一项正在向部分站长开放的 Search Console 功能控制
- 主要取舍
- 禁止后,符合条件的模型训练会受限,也会失去官方列出的实时采信机会;Google 没有为这两类用途分别提供开关
Google-Extended 是 robots.txt 中控制内容后续用途的开关,并不是拥有独立请求身份的 AI 爬虫。
1. Google-Extended 是什么
Google-Extended 是一项可写入 robots.txt User-agent: 字段的独立产品令牌(product token)。Google 根据相应规则,决定现有爬虫抓取的内容能否用于官方列出的 Gemini 训练,或作为采信(grounding)依据(见 Google’s common crawlers)。
这里有两个概念不能混为一谈。这个令牌使用 robots.txt 的语法,但并不代表一个 HTTP 客户端。Google 明确说明,Google-Extended 没有独立的 User-Agent 字符串。
| 字段 | 当前含义(核对日期:2026 年 7 月 22 日) |
|---|---|
| 对象类型 | 控制内容用途的独立产品令牌 |
| 请求身份 | 没有独立的 HTTP 用户代理身份 |
| 实际抓取 | 由 Google 现有的用户代理完成 |
| 控制的用途 | Google 官方文档列出的 Gemini 训练与采信 |
| Google 搜索 | 不影响普通搜索的收录或排名 |
Google 的 common crawlers 页面既介绍实际发出请求的爬虫,也介绍面向具体产品的控制令牌,因此 Google-Extended 会列在其中。不能仅凭页面所属目录判断其性质,仍应以 Google 当前爬虫文档 对各字段的明确说明为准。
这种做法在 Robots Exclusion Protocol 中并不常见。按照 RFC 9309 的通常约定,爬虫产品令牌应出现在相应的 HTTP User-Agent 字符串中。Google 则明确将 Google-Extended 用作内容用途控制令牌。因此,应把它视为用途控制令牌,而不是身份未公开的爬虫。
2. 没有独立爬虫,控制规则如何生效
系统会分开处理抓取请求与抓取后的用途判断:
Google 现有用户代理抓取 URL
│
▼
Google 读取该主机的 Google-Extended 规则
│
┌─────┴─────┐
▼ ▼
允许使用 禁止使用
│ │
▼ ▼
用于列出的训练 排除在列出的训练
或采信流程 或采信流程之外
禁止规则不会阻止抓取请求本身。Googlebot 仍可能为搜索而抓取同一 URL,服务器日志也会继续记录 Googlebot,而不是 Google-Extended。规则限制的是抓取后的用途,也就是 Google 能否将内容用于文档列出的流程。
同理,只匹配 Google-Extended 的 WAF 规则也不会生效。这个令牌没有可供匹配的请求字符串、专属 IP 范围,也没有用于核验身份的反向 DNS。网络层决定请求能否获取内容;Google-Extended 决定已获取的内容可以用于什么目的。
常见的训练或检索爬虫会同时声明请求身份和用途,用户触发型代理则代表用户发起访问。Google-Extended 与这两类情况都不同:它只声明允许哪些用途,本身并不发出请求。不同类别的区别见 AI 爬虫。
Applebot-Extended 的工作方式相似:它本身不抓取页面,只控制 Applebot 已抓取数据的用途。不过,两者适用范围不同。Apple 的令牌用于基础模型训练,Google 当前的令牌还涵盖若干实时采信用途。
3. 它控制哪些 Gemini 用途
Google 当前将两类用途归入同一个令牌。因此,只把 Google-Extended 当作训练退出开关已不准确。
| 用途类别 | Google 当前列出的产品或功能 | 禁止后的影响 |
|---|---|---|
| 未来模型训练 | 供 Gemini Apps 和 Vertex AI API for Gemini 使用的模型 | 内容不再用于符合条件的训练 |
| Gemini 采信 | Gemini Apps | 内容不再作为官方列出的实时采信依据 |
| Google Cloud 产品中的 Google 搜索采信 | 支持此功能的 Google Cloud 产品 | 内容不再用于这类采信 |
| 搜索生成式 AI 所用模型的训练 | 用于生成搜索 AI 回答的模型 | 按照 Google 的说明,发布者应使用 Google-Extended 限制这项训练 |
Google Cloud 的产品名称仍在变化。当前的 Grounding with Google Search 文档 明确说明,Gemini Enterprise Agent Platform 不会把禁止 Google-Extended 的网页作为采信依据。Google 已将较早的 Vertex AI 文档迁移至新的产品目录,因此复核策略时应以当前官方页面为准,不能只看某个固定的产品名称。
这项控制推出时间不长,适用范围却已发生重要变化:
2023-09-28 2026-06-03 2026-07-22
首次发布 搜索 AI 另设控制 当前核对范围
Bard 与 Vertex → 单独测试 Search → Gemini 训练与
AI 模型用途 AI 控制 列出的采信用途
发布之初,Google 的说明 是让网站决定其内容能否用于改进 Bard 和 Vertex AI 生成式 API,包括这些产品未来版本的模型。Bard 后来更名为 Gemini,Google 也在使用说明中加入了采信用途。适用产品清单会随相关政策持续更新,不能据此推断 Google-Extended 将永久覆盖 Google 的所有 AI 产品。
这个令牌的适用范围应以 Google 明确列出的用途为准,不能把它理解为覆盖 Google 的全部模型训练、Google Gemini 下的每一种产品,或 Google 对网页内容的所有使用方式。
4. Google 搜索、AI Overviews 与 AI Mode
最常见的误解是,以为禁止 Google-Extended 就能让网站退出 Google AI Overviews 或 AI Mode。它并不决定网站链接和内容能否出现在这些搜索功能中。
Google 当前提供的相关控制分属不同层次:
| 功能或决策 | 当前控制手段 | Google-Extended 的作用 |
|---|---|---|
| 普通搜索的抓取与索引 | Googlebot、robots.txt、noindex 及其他搜索控制 | 不影响收录或排名 |
| 搜索摘要及可展示的页面片段 | nosnippet、max-snippet、data-nosnippet、预览控制 | 不直接参与 |
| 搜索生成式 AI 中的展示与采信 | Search Console 的搜索生成式 AI 控制(如已开放) | Google-Extended 不参与,另有独立控制 |
| 生成搜索 AI 回答所用模型的训练 | Google-Extended | Google 指示发布者使用此令牌 |
| 官方列出的 Gemini Apps 与 Cloud 采信 | Google-Extended | 可直接控制这些用途 |
页面能否进入这些搜索功能,仍取决于 Googlebot。Google 的 2026 年 7 月 AI 优化指南 说明,页面必须已被索引,并符合显示搜索摘要的条件;若该项独立控制已向相应的 Search Console 资源开放,还须通过该资源允许页面进入搜索生成式 AI 功能。搜索 AI 采用检索增强生成(retrieval-augmented generation,RAG),从 Google 搜索索引中选取页面。
这项独立搜索控制推出不久,尚未全面开放。2026 年 1 月,Google 还在研究如何让网站单独退出搜索生成式 AI 功能;6 月 3 日,Google 开始面向部分英国站长测试 Search Console 开关。截至 7 月 22 日,帮助页仅说明该功能正在向部分站长开放,尚未宣布在全球正式推出。
通过该开关排除某项 Search Console 资源后,其链接和内容将不会出现在 AI Overviews、AI Mode 以及 Discover 的生成式 AI 功能中,也不会成为这些功能的采信依据。网站将失去这些功能带来的展示和流量。Google 表示,这项选择不会成为其他搜索功能的收录或排名信号。
Search Console 帮助页 还明确说明,该开关不控制 AI 训练。如果要限制生成搜索 AI 回答所用模型的训练,Google 仍要求发布者使用 Google-Extended。因此,Google-Extended 不影响搜索排名,却能限制这类模型训练,两者并不矛盾。
5. 如何编写 robots.txt 规则
若要禁止该主机上的所有内容用于 Google-Extended 列出的用途,可在该主机的 robots.txt 中加入具名规则组:
User-agent: Google-Extended
Disallow: /
这不会阻止 Googlebot。如果搜索可见度很重要,应采用上述规则,不要改为禁止 Googlebot。
按路径设置时,可以允许一份公开报告,同时禁止同一目录中的其他内容:
User-agent: Google-Extended
Disallow: /members/
Allow: /members/public-report/
由于公开报告的 Allow 路径更长、更具体,因此会优先匹配;/members/ 下的其余内容仍不得用于 Google 为该令牌列出的用途。
Google 的 robots.txt 解析规则 有几个要点,需要逐项测试:
- 产品令牌匹配不区分大小写,但 URL 路径可能区分大小写。
- 针对同一具名令牌的多个规则组会合并。
- 具名令牌的规则组不会与通配符
*的规则组合并。 - 最具体的匹配路径优先;长度相同时,采用限制较少的规则。
实际配置仍建议沿用官方大小写。这样既便于审核,也可避免通用解析器、检查工具或同事将有效但少见的写法误判为拼写错误。
如果没有适用的禁止规则,就表示允许文档列出的用途。空的 Disallow: 并不是退出设置,只用注释说明策略也无法形成机器可读的规则。
robots.txt 按协议、主机和端口分别生效。不能假定 https://example.com/robots.txt 中的规则也适用于 https://docs.example.com、http://example.com 或非默认端口上的服务。协议细节和异常响应见 robots.txt,部署检查见 AI 爬虫访问审计。
6. 无法通过日志识别时,如何验证策略
Google-Extended 不会产生独立的流量标识,因此验证工作应以配置为依据。
| 可以直接验证 | 无法直接确认 | 不能据此声称 |
|---|---|---|
目标 /robots.txt 以纯文本返回 200 | 是否有抓取专门服务于 Google-Extended 所列用途 | 禁止规则会删除此前收集的数据 |
| 每种协议、主机和端口均提供预期的规则组 | 与这些用途相关的抓取是否已经停止 | 某个历史模型已经移除这些训练数据 |
| 解析器对代表性路径给出预期结果 | 某次请求是否只服务于这一后续用途 | 除非 Google 明确公布,否则不能声称所有产品都遵循统一的生效时限 |
| CDN 与源站返回同一份最新文件 | Googlebot 继续访问是否意味着配置失败 | robots.txt 能保护机密内容或强制执行版权限制 |
| Google 对受影响产品的说明没有变化 | 仅凭普通服务器日志辨明 Google 的每一种内部用途 | Google-Extended 覆盖 Google 未列出的产品 |
检查时,应分别从源站网络内外发起请求。即使源文件正确,过期的 CDN 缓存、平台自动生成的 robots 文件、不同环境的 URL 处理方式,或错误主机上的重定向,也可能使实际生效的配置难以确认。
至少测试一条允许路径、一条禁止路径及两者的边界。如果存在多个 Google-Extended 规则组,还应测试合并后的结果。应保存实际返回的内容、变更时间、负责人和策略理由。
不要将 Googlebot 抓取量下降视为成功指标。Googlebot 仍服务于搜索,抓取量保持稳定属于正常现象。AI 爬虫访问审计 可以核对配置部署和普通爬虫身份,但日志不会显示独立的 Google-Extended 机器人,因为这个令牌本身并不代表机器人。
还应定期复核官方文档。Google-Extended 发布后,训练与采信范围已经变化;Google Cloud 的产品目录在 2026 年再次调整;独立的搜索 AI 控制也在五个月内从研究阶段进入有限测试。
7. 常见配置错误
| 错误做法 | 为什么看起来合理 | 实际后果 |
|---|---|---|
为拒绝 Gemini 训练而禁止 Googlebot | 实际抓取由 Googlebot 完成 | 可能损害搜索抓取、索引,以及进入搜索 AI 功能的资格 |
在日志中搜索 Google-Extended | 大多数机器人令牌都代表请求身份 | 不会匹配到请求,因为它没有 HTTP 用户代理 |
| 把它当作只控制训练的令牌 | 发布之初主要强调训练 | 当前文档还列出了 Gemini Apps 与 Google Cloud 的采信用途 |
| 用它退出 AI Overviews 或 AI Mode | 这些功能也使用 Gemini 模型 | 搜索中的展示与采信由另一项 Search Console 控制决定 |
| 认为它与搜索 AI 完全无关 | 它确实不控制搜索收录或排名 | Google 要求用它限制生成搜索 AI 回答所用模型的训练 |
| 把 llms.txt 当作退出设置 | 它可供机器读取,也与 AI 有关 | Google 搜索会忽略它,它也无法表达是否允许 Google-Extended 所列用途 |
| 把 robots.txt 当作安全防护 | 指令名称中有 Disallow | RFC 9309 明确说明这些规则不是访问授权 |
| 仅更新主域名 | 容易误以为一份文件可以覆盖全站 | 子域名、协议、端口或 CDN 边缘节点可能提供不同策略 |
| 认为设置一次便永久有效 | 指令本身不会过期 | 适用产品与搜索控制会变化,静态文件不会自动跟进 |
代价最大的错误,是为了拒绝官方列出的后续 AI 用途而一并禁止 Googlebot,进而影响普通搜索。如果目标是保留普通搜索,同时拒绝 Google-Extended 控制的用途,就应保持 Googlebot 可抓取,并单独配置 Google-Extended。部署任何「阻止全部 AI」的预设前,都应逐行检查规则。
风险最高的错误,是将 robots.txt 当作安全机制。私有内容、需要授权的内容或仅限客户访问的内容,都必须采用身份验证和访问授权。robots.txt 是一份公开且依赖自愿遵守的文件,无法阻止不合规客户端、伪造的用户代理或普通浏览器访问已公开的 URL。
8. 如何选择访问策略
目前没有哪种设置能在拒绝训练的同时保留 Google-Extended 列出的所有采信机会。选择时必须明确相应取舍。
| 发布者目标 | 指令或控制 | 对可见度和内容用途的影响 |
|---|---|---|
| 保留普通搜索和搜索 AI 中的展示,拒绝 Google-Extended 列出的用途 | 允许 Googlebot 抓取;禁止 Google-Extended | 进入普通搜索的资格不受影响,但内容将无法用于符合条件的训练,也会失去官方列出的 Gemini 与 Cloud 产品采信机会 |
| 允许官方列出的训练与采信 | 不禁止 Google-Extended | 内容仍可用于 Google 当前列出的用途 |
| 退出 AI Overviews、AI Mode 与 Discover 中的生成式 AI 功能 | 如已开放,使用 Search Console 生成式 AI 控制 | 链接和内容不再出现在这些功能中,也不再被采信,因此会失去展示和流量;这项设置不影响其他搜索功能 |
| 完全退出 Google 搜索 | 使用 noindex 等搜索专用控制 | 失去普通搜索可见度;只用 Google-Extended 无法做到 |
| 保护非公开或付费内容 | 要求身份验证和访问授权 | 内容不再供公开抓取;robots.txt 只能作为补充声明 |
真正需要决定的是,是否同时允许训练和采信,而不是设想可以只拒绝训练、不承担其他代价。网站可能不愿让内容进入未来模型训练,却希望作为最新信息来源被 Gemini Apps 或支持 Google 搜索采信的 Cloud 产品引用。目前,这个令牌无法分别表达这两个目标。
是否参与搜索 AI 功能,还要单独决定。发布者可以保留普通搜索,同时通过尚在有限开放阶段的 Search Console 控制退出 AI Overviews 和 AI Mode;代价是失去这些功能可能带来的展示和流量。这项控制不能替代 Google-Extended;若要限制符合条件的模型训练,仍须使用后者。
两项选择都应记录在案,注明预期用途、负责人、涉及的 Search Console 资源与主机、具体指令或控制设置、部署日期和下次复核日期。可通过 AI 爬虫访问审计 留存部署证据,并结合 Google Gemini 与 Google AI Overviews 评估平台影响。
参考资料
Google 产品控制与文档:
- Google Crawling Infrastructure — Google’s common crawlers
- Google Search Console Help — Search generative AI control
- Google Search Central — Optimizing your website for generative AI features on Google Search
- Google Cloud — Grounding with Google Search
- Google — An update on web publisher controls
- Google — Our approach to website controls for Search AI features
- Google — New opportunities, control and insights for website owners
协议与对照:
- Google Crawling Infrastructure — How Google interprets the robots.txt specification
- IETF — RFC 9309: Robots Exclusion Protocol
- Apple — About Applebot
常见问题
Google-Extended 是爬虫吗?
禁止 Google-Extended 会影响 Google 搜索排名吗?
Google-Extended 能让网站退出 AI Overviews 或 AI Mode 吗?
服务器日志能证明 Google-Extended 规则已经生效吗?
我能禁止 Gemini 训练,同时保留 Google-Extended 涵盖的全部采信用途吗?
延伸阅读
参考来源
一手来源
- Google's common crawlers · Google Crawling Infrastructure · 2026-07-14
- Search generative AI control · Google Search Console Help
- Optimizing your website for generative AI features on Google Search · Google Search Central · 2026-07-10
- Grounding with Google Search · Google Cloud · 2026-07-21
- An update on web publisher controls · Google · 2023-09-28
- Our approach to website controls for Search AI features · Google · 2026-01-28
- New opportunities, control and insights for website owners · Google · 2026-06-03
- How Google interprets the robots.txt specification · Google Crawling Infrastructure · 2026-07-08
- RFC 9309: Robots Exclusion Protocol · IETF
- About Applebot · Apple · 2026-06-08