Sitemap 与 IndexNow
速览要点
- 它们是什么
- 两种 URL 提交协议:sitemap.xml(2005 年,拉取模式,几乎所有主流搜索引擎都读取)和 IndexNow(2021 年,推送模式,只有 Microsoft、Yandex 等参与方采用)
- 对 AI 搜索的作用
- 二者都先作用于传统搜索索引,再间接影响 AI 搜索:Google AI Overviews 使用 Google 索引中的 sitemap 信息,Bing Copilot 使用 Bing 索引中的 sitemap 与 IndexNow 信息;独立答案引擎不读取这两份文件
- IndexNow 参与方(2026-05)
- Microsoft Bing、Yandex、Naver、Seznam.cz、Yep。Google 自 2021 年那次测试公告之后没有加入;任何 AI 厂商的第一方爬虫也都没有加入
- 最常见的失误
- 向 IndexNow 推送 URL,却期望 ChatGPT、Perplexity 或 Claude 同步刷新,问题在于这些引擎并不在参与方名单中。IndexNow 只能先通知 Bing,再间接影响 Copilot;独立引擎按自己的节奏抓取
- 在 Answer Loop 里的位置
- 这一步发生在 AI 爬虫抓取之前,帮助引擎发现 URL,但不决定内容是否被引用。它是必要条件,不是充分条件:提交了也不等于原文会被采用
1. 什么是 sitemap.xml 和 IndexNow
sitemap.xml 和 IndexNow 都用于提交 URL,但用途并不完全相同。sitemap.xml 出现得更早,于 2005 年作为开放标准发布(sitemaps.org),采用 拉取(pull)模式:发布方把 URL 清单放在固定位置,搜索引擎按各自的抓取节奏读取。Googlebot、Bingbot、YandexBot 等主流搜索爬虫都支持这项协议。
IndexNow 较新,由 Microsoft 与 Yandex 于 2021 年联合推出(indexnow.org),采用 推送(push)模式:URL 一旦发生变更,发布方就向参与方提供的接口发送通知,接收方可在数分钟内更新自己的索引。截至 2026-05,参与方包括 Microsoft Bing、Yandex、Naver、Seznam.cz、Yep(indexnow.org)。Google 在 2021 年宣布测试后并未加入;AI 厂商的第一方爬虫也均未加入。
对 GEO 而言,最重要的是:这两套机制都先影响传统搜索索引,再由相关索引间接影响 AI 搜索。Google AI Overviews 使用 Google 搜索中的 sitemap 信息,因为 AIO 的采信(grounding)建立在 Google 经典网页索引之上;Bing Copilot 同样会使用 Bing 索引中的 sitemap 与 IndexNow 信息。独立答案引擎则不同:ChatGPT Search、Perplexity、Claude 各自运行独立的检索(retrieval)爬虫,抓取节奏也各不相同,三家公开的爬虫文档均未说明会读取 sitemap.xml 或 IndexNow。
按 Answer Loop 的流程,这一步发生在 AI 爬虫 开始抓取之前:引擎先发现页面(URL 出现在某份清单中),再由爬虫抓取,页面进入索引后才能被检索,最后还要看 可引用性,也就是页面被读取后,原文能否直接用于答案。提交是必要条件,不是充分条件;它只能让页面有机会成为候选来源,不能保证页面会被引用。
2. 协议的实际做法
两种协议在五个实际方面各不相同,下表逐项对照:
| 维度 | sitemap.xml | IndexNow |
|---|---|---|
| 标准 | 由 sitemaps.org 于 2005 年发布的开放协议 | 由 Microsoft 与 Yandex 于 2021 年推出的 indexnow.org 协议 |
| 模式 | 引擎按自身的抓取节奏拉取清单 | URL 变更时,由发布方主动推送通知 |
| 读取方 | Googlebot、Bingbot、YandexBot,以及几乎所有主流搜索爬虫 | Microsoft Bing、Yandex、Naver、Seznam.cz、Yep。Google 没有加入,任何 AI 厂商的第一方爬虫也都没有加入 |
| 延迟 | 通常为数小时到数天,具体取决于引擎的抓取节奏 | 通常为数分钟,因为发布方会在内容变更时主动推送 |
| 提交方式 | 在 robots.txt 中使用 Sitemap: 指令,还可以选择通过 Search Console 或 Webmaster Tools 提交 | URL 变更时,向任一参与方的接口发送 HTTP 请求,并附上 URL 和密钥(key) |
| 规模上限 | 单个文件最多包含 50,000 条 URL,未压缩时不得超过 50 MB;超过上限的站点应使用 sitemap 索引(sitemap index),详见 sitemaps.org | 单批 POST 最多可提交 10,000 条 URL;密钥可以是任意令牌,并托管在站点根目录 |
发布方接入 IndexNow 的方式很简单:URL 变更时发送一次 HTTP 请求,并在站点根目录放置密钥文件即可。它不使用 API 令牌,也不要求发布方分别向每家引擎验证身份。最简推送方式如下:
# IndexNow 最简推送示例:只演示原理,并非完整客户端
1. 将 <your-key>.txt 托管在站点根目录,文件内容就是 <your-key>
例:https://example.com/abc123.txt → 内容:abc123
2. URL 变更时,使用 GET 提交单条 URL:
https://api.indexnow.org/IndexNow?url=https://example.com/page&key=abc123
或使用 POST 批量提交,单批最多 10,000 条:
POST https://<participating-engine>/indexnow
Content-Type: application/json
{ "host": "example.com",
"key": "abc123",
"urlList": ["https://example.com/page1", "https://example.com/page2"] }
3. 接收方会自动将这次提交转发给其他 IndexNow 参与方
(Bing → Yandex → Naver → Seznam → Yep)。
只需推送一次,五家都会收到。
完整的 JSON 格式与各引擎的接口列表见 官方规范。包括 Cloudflare 在内的 CDN 都提供一键启用功能,可代站点推送 IndexNow(Cloudflare,2021);因此,许多站点即使没有自行编写代码,也已经在发送 IndexNow 通知。
Google 与 IndexNow 的关系还需单独说明。Google 在 2021 年 11 月宣布以可持续性为目标测试这套协议(Search Engine Land,2021-11-09),但测试并未带来正式采纳;到 2024 年,独立报道仍得出相同结论(ppc.land,2024-12-30)。实际结论很明确:一次 IndexNow 推送会通知 Bing、Yandex、Naver、Seznam、Yep;这些搜索索引中,目前只有 Bing 的数据会进一步用于 AI 答案,由 Bing Copilot 使用。
3. 各 AI 引擎受到什么影响:对照表
判断标准只有一个:这家 AI 引擎是否使用了支持这些协议的传统搜索索引。按此可以把引擎分为三类。
| AI 引擎 | sitemap.xml | IndexNow | 为什么 |
|---|---|---|---|
| Google AI Overviews | 使用(通过 Google 索引) | 不使用,因为 Google 没有加入 IndexNow | AIO 的采信建立在 Google 经典网页索引之上;通过 Search Console 提交 sitemap 有助于 Google 更快发现页面,页面也随之有机会成为 AIO 的候选来源 |
| Bing Copilot | 使用(通过 Bing 索引) | 使用(通过 Bing 索引) | IndexNow 是 Microsoft 主推的协议;Copilot 使用 Bing 索引,因此一次推送可让 Bing 在数分钟内更新索引,Copilot 可用的候选来源也会同步更新 |
| ChatGPT Search · Perplexity · Claude | 间接帮助发现:三家各自运行独立的检索爬虫,抓取节奏也各不相同;robots.txt 中的 Sitemap: 指令可能有助于发现页面,但并非必需 | 不使用:三家公开的爬虫文档均未提到 IndexNow 或任何 URL 提交协议 | 每家都维护独立的检索索引,也都没有对外提供 URL 提交通道 |
正确理解这张表的关键是:只有当 AI 引擎使用了支持这些协议的传统搜索索引时,提交协议才会发挥作用。Google AI Overviews 使用 Google 索引中的 sitemap 信息;Bing Copilot 同时使用 Bing 索引中的 sitemap 与 IndexNow 信息;独立答案引擎则依靠自己的爬虫,不使用这两项提交信息。因此,认为「推送 IndexNow 就能让 ChatGPT 引用我」,是混淆了两类引擎的工作方式(详见 §6)。
4. 向 AI 索引提交 URL:能做什么,不能做什么
从业者最常提出的问题是:如何把 URL 提交给 ChatGPT、Perplexity 或 Claude?截至 2026-05,答案是:无法直接提交。任何一家主流的独立答案引擎都没有第一方的 URL 提交通道。
目前可用的提交通道(均先提交到传统搜索索引,再间接影响 AI 答案):
- Google Search Console:通过 sitemap 提交与 URL Inspection 将内容提交到 Google 经典网页索引,AI Overviews 直接使用这套索引(Build and submit a sitemap)
- Bing Webmaster Tools:通过 sitemap 提交与 URL Submit 将内容提交到 Bing 索引,Bing Copilot 直接使用这套索引
- IndexNow:推送通知可让 Bing、Yandex、Naver、Seznam、Yep 的索引在数分钟内更新;其中 Bing 索引的数据还会用于 Copilot,这是目前延迟最低的方式(How to add IndexNow)
不存在的提交通道:
- OpenAI、Anthropic、Perplexity 三家都没有第一方的 URL 提交 API;三家的爬虫文档说明的都是 robots.txt、IP 段白名单和访问策略,均未说明如何提交 URL(OpenAI;Anthropic;Perplexity)
- 「Google 接受 IndexNow」是一种常见误解,Google 至今没有加入这套协议
- 也不存在任何一种可以一次向所有 AI 答案系统提交 URL 的统一通道
简而言之,目前无法把 URL 直接「提交给 AI」,只能提交到传统搜索索引,再由使用这些索引的 AI 答案系统获取。至于 ChatGPT 或 Perplexity 能否发现页面,关键不在于把 URL 提交到某个地方,而在于两个基础条件:页面内容便于检索爬虫读取后直接采用(可引用性),并且爬虫确实能够访问页面(AI 爬虫)。
5. sitemap.xml ≠ llms.txt ≠ robots.txt:三个文件,三种用途
完整的爬虫访问与内容发现配置通常包含三个站点根目录文件,但三者经常被混淆。每个文件各有明确用途,不能相互替代。
| 文件 | 作用 | 不具备的功能 |
|---|---|---|
| robots.txt | 访问控制:决定爬虫能否抓取指定 URL | 它不列出 URL,不传达内容新鲜度,也不声明清单是否完整 |
| sitemap.xml | 页面发现与清单完整性:列出希望被索引的全部页面 | 它不负责精选内容,不授予访问权限,也不能作为质量信号 |
| llms.txt | 精选内容与简洁排版:列出建议优先阅读的页面,并采用简洁的 Markdown 排版 | 它既不授予也不拒绝访问,不声明清单是否完整,也不传达索引意图 |
sitemap.xml 不是精选清单,不是访问规则,也不是「最佳页面」目录,而是一份完整的 URL 清单。 如果只把筛选后的页面写入 sitemap.xml,就违背了这项协议的用途:精选内容应使用 llms.txt;sitemap.xml 则必须包含希望被索引的全部内容,缺失的 URL 会被引擎视为覆盖不足。llms.txt §4 从 llms.txt 的角度给出了同一组对照,可结合阅读。
6. 反模式:提交什么时候会适得其反或毫无作用
下面几种做法乍看合理,实际问题各不相同:有的误解了协议覆盖范围,有的弄错了参与方,还有的混淆了文件用途。
| 反模式 | 看似合理的理由 | 实际问题 |
|---|---|---|
| 「推送 IndexNow 之后,页面就会出现在 ChatGPT、Perplexity 或者 Claude 里」 | IndexNow 是开放标准,有些 AI 厂商也表示会遵守 Web 标准 | IndexNow 的参与方名单(indexnow.org)只有 Bing、Yandex、Naver、Seznam、Yep,并不包括任何 AI 厂商的爬虫。IndexNow 只能先通知 Bing,再通过 Bing 索引间接影响 Copilot |
| 「只在 sitemap.xml 中列出优质页面,供 AI 引擎查看」 | GEO 强调精选内容,因此页面越少、质量越高似乎越合适 | 这种做法违背了 sitemap.xml 的用途。这项协议要求清单保持完整,希望被索引的 URL 都应列入。引擎会把筛选后的子集视为覆盖不完整,而不是质量信号。精选内容应使用 llms.txt |
「在 sitemap.xml 中加入 noindex 或 canonical 指向别处的 URL;列入的 URL 越多越好」 | 直觉上看,列出的 URL 越多,发现范围似乎就越广 | sitemap 与页面信号不一致,会干扰引擎对页面质量的判断。Google 的 sitemap 文档明确说明了哪些 URL 应当列入、哪些不应列入(Build and submit a sitemap) |
| 「尝试向 Google 推送 IndexNow,即使无效也不会造成损失」 | 推送速度通常快于拉取,因此即使无效,似乎也不会造成损失 | 自 2021 年那次测试公告之后,Google 一直没有加入 IndexNow(Search Engine Land,2021;到 2024 年,独立报道仍是同一判断 ppc.land)。这种提交没有接收方,却会在监控面板中制造噪声。向 Google 提交 URL 只能使用 Search Console |
URL 提交是 GEO 的基础工作,但不是决定引用的关键。 它让页面有机会进入传统搜索索引;页面是否会进一步成为 AI 答案的候选来源,则取决于具体引擎。真正影响页面最终能否被引用的因素包括:可引用性、E-E-A-T、实体识别。如果在提交上投入过多,例如反复筛选 sitemap,或向未参与协议的引擎推送 IndexNow,并不会增加引用;投入不足,页面甚至可能没有机会成为候选来源。正确完成即可,无需反复优化。
7. 对 GEO 有什么影响,应该怎么做
| 你的需求 | 建议做法 |
|---|---|
| 让 Google 发现我的站点,使页面有机会成为 AIO 的候选来源 | 通过 Google Search Console 提交 sitemap(Build and submit a sitemap),并在 robots.txt 中添加 Sitemap: 指令 |
| 让 Bing 发现我的站点,使页面有机会成为 Copilot 的候选来源 | 通过 Bing Webmaster Tools 提交 sitemap,并接入 IndexNow(How to add IndexNow) |
| 让 Bing 在数分钟内发现新 URL,并供 Copilot 使用 | 按 indexnow.org/documentation 接入 IndexNow;最简调用方式见 §2 |
| 让 ChatGPT、Perplexity 或者 Claude 引用我 | 目前没有提交通道,应提高内容的 可引用性,同时确保检索爬虫能够访问页面(见 AI 爬虫) |
| 在一次 GEO 整体审计中同时检查索引覆盖与爬虫访问 | GEO 审计 会分别检查 sitemap 是否存在、爬虫能否访问页面 |
| 让爬虫访问页面后能够正确解析内容 | SSR for AI Crawlers:这属于渲染问题,需要单独处理 |
| 在协议层面管控爬虫访问 | 具体配置见 AI 爬虫 与 robots.txt |
| 区分 sitemap.xml、llms.txt、robots.txt | 见上文 §5;llms.txt §4 也从 llms.txt 的角度对照了这三个文件 |
sitemap.xml 是 GEO 必不可少的基础配置;IndexNow 成本很低,对于通过 Bing Copilot 获得的 AI 曝光也值得启用。 两者都不是 GEO 中决定引用的关键;进一步投入的重点仍是 可引用性、E-E-A-T、实体识别。完善索引提交后,应把额外资源用于真正影响引用的环节。
参考资料
一手来源(协议规范):
- sitemaps.org — Sitemaps XML format — Protocol(2005 年起的开放标准)
- indexnow.org — Documentation · Homepage(参与方名单)
一手来源(引擎文档):
- Google Search Central — Build and submit a sitemap
- Microsoft Bing — How to add IndexNow to your website · Bing Webmaster Guidelines
- OpenAI — Overview of OpenAI Crawlers(无 URL 提交协议相关说明)
- Anthropic — Does Anthropic crawl data from the web(无 URL 提交协议相关说明)
- Perplexity — Perplexity Crawlers(无 URL 提交协议相关说明)
一手来源(历史记录):
- Search Engine Land — Google is testing the IndexNow protocol for sustainability(2021-11-09;Google 此后没有正式采纳)
二手来源(独立报道与基础设施):
- ppc.land — Google’s absence from IndexNow raises questions about web indexing standards(2024-12-30;该报道确认 Google 仍未加入)
- Cloudflare — Cloudflare now supports IndexNow(2021-10-18;Cloudflare 可代站点推送 IndexNow)
- Search Engine Land — IndexNow — new initiative by Microsoft and Yandex(2021-10-18;上线时的独立报道)
常见问题
提交 sitemap 或推送 IndexNow,能让我的页面被 AI 搜索引擎引用吗?
Google 现在接受 IndexNow 提交吗?
Sitemap: 指令、Search Console 的 sitemap 提交功能或 URL Inspection;此外还有用途很窄的 Indexing API,仅接收招聘启事和直播内容。ChatGPT Search、Perplexity、Claude 会读 sitemap.xml 或 IndexNow 吗?
可以只在 sitemap.xml 中列出优质页面,供 AI 引擎查看吗?
目前该如何向 AI 引擎提交 URL?
延伸阅读
参考来源
一手来源
- Sitemaps XML format — Protocol · sitemaps.org
- IndexNow — Documentation · indexnow.org
- IndexNow — homepage (participating engines) · indexnow.org
- How to add IndexNow to your website (Bing Webmaster Tools) · Microsoft Bing
- Build and submit a sitemap · Google Search Central · 2025-12-10
- Bing Webmaster Guidelines · Microsoft Bing
- Overview of OpenAI Crawlers (GPTBot / OAI-SearchBot / ChatGPT-User) · OpenAI
- Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic · 2026-04-07
- Perplexity Crawlers · Perplexity AI
- Google is testing the IndexNow protocol for sustainability · Search Engine Land · 2021-11-09