跳到正文

Sitemap 与 IndexNow

速览要点

它们是什么
两种 URL 提交协议:sitemap.xml(2005 年,拉取模式,几乎所有主流搜索引擎都读取)和 IndexNow(2021 年,推送模式,只有 Microsoft、Yandex 等参与方采用)
对 AI 搜索的作用
二者都先作用于传统搜索索引,再间接影响 AI 搜索:Google AI Overviews 使用 Google 索引中的 sitemap 信息,Bing Copilot 使用 Bing 索引中的 sitemap 与 IndexNow 信息;独立答案引擎不读取这两份文件
IndexNow 参与方(2026-05)
Microsoft Bing、Yandex、Naver、Seznam.cz、Yep。Google 自 2021 年那次测试公告之后没有加入;任何 AI 厂商的第一方爬虫也都没有加入
最常见的失误
向 IndexNow 推送 URL,却期望 ChatGPT、Perplexity 或 Claude 同步刷新,问题在于这些引擎并不在参与方名单中。IndexNow 只能先通知 Bing,再间接影响 Copilot;独立引擎按自己的节奏抓取
在 Answer Loop 里的位置
这一步发生在 AI 爬虫抓取之前,帮助引擎发现 URL,但不决定内容是否被引用。它是必要条件,不是充分条件:提交了也不等于原文会被采用

1. 什么是 sitemap.xml 和 IndexNow

sitemap.xml 和 IndexNow 都用于提交 URL,但用途并不完全相同。sitemap.xml 出现得更早,于 2005 年作为开放标准发布(sitemaps.org),采用 拉取(pull)模式:发布方把 URL 清单放在固定位置,搜索引擎按各自的抓取节奏读取。Googlebot、Bingbot、YandexBot 等主流搜索爬虫都支持这项协议。

IndexNow 较新,由 Microsoft 与 Yandex 于 2021 年联合推出(indexnow.org),采用 推送(push)模式:URL 一旦发生变更,发布方就向参与方提供的接口发送通知,接收方可在数分钟内更新自己的索引。截至 2026-05,参与方包括 Microsoft Bing、Yandex、Naver、Seznam.cz、Yep(indexnow.org)。Google 在 2021 年宣布测试后并未加入;AI 厂商的第一方爬虫也均未加入。

对 GEO 而言,最重要的是:这两套机制都先影响传统搜索索引,再由相关索引间接影响 AI 搜索。Google AI Overviews 使用 Google 搜索中的 sitemap 信息,因为 AIO 的采信(grounding)建立在 Google 经典网页索引之上;Bing Copilot 同样会使用 Bing 索引中的 sitemap 与 IndexNow 信息。独立答案引擎则不同:ChatGPT Search、Perplexity、Claude 各自运行独立的检索(retrieval)爬虫,抓取节奏也各不相同,三家公开的爬虫文档均未说明会读取 sitemap.xml 或 IndexNow。

按 Answer Loop 的流程,这一步发生在 AI 爬虫 开始抓取之前:引擎先发现页面(URL 出现在某份清单中),再由爬虫抓取,页面进入索引后才能被检索,最后还要看 可引用性,也就是页面被读取后,原文能否直接用于答案。提交是必要条件,不是充分条件;它只能让页面有机会成为候选来源,不能保证页面会被引用。

2. 协议的实际做法

两种协议在五个实际方面各不相同,下表逐项对照:

维度sitemap.xmlIndexNow
标准由 sitemaps.org 于 2005 年发布的开放协议由 Microsoft 与 Yandex 于 2021 年推出的 indexnow.org 协议
模式引擎按自身的抓取节奏拉取清单URL 变更时,由发布方主动推送通知
读取方Googlebot、Bingbot、YandexBot,以及几乎所有主流搜索爬虫Microsoft Bing、Yandex、Naver、Seznam.cz、Yep。Google 没有加入,任何 AI 厂商的第一方爬虫也都没有加入
延迟通常为数小时到数天,具体取决于引擎的抓取节奏通常为数分钟,因为发布方会在内容变更时主动推送
提交方式在 robots.txt 中使用 Sitemap: 指令,还可以选择通过 Search Console 或 Webmaster Tools 提交URL 变更时,向任一参与方的接口发送 HTTP 请求,并附上 URL 和密钥(key)
规模上限单个文件最多包含 50,000 条 URL,未压缩时不得超过 50 MB;超过上限的站点应使用 sitemap 索引(sitemap index),详见 sitemaps.org单批 POST 最多可提交 10,000 条 URL;密钥可以是任意令牌,并托管在站点根目录

发布方接入 IndexNow 的方式很简单:URL 变更时发送一次 HTTP 请求,并在站点根目录放置密钥文件即可。它不使用 API 令牌,也不要求发布方分别向每家引擎验证身份。最简推送方式如下:

# IndexNow 最简推送示例:只演示原理,并非完整客户端

1. 将 <your-key>.txt 托管在站点根目录,文件内容就是 <your-key>
   例:https://example.com/abc123.txt  →  内容:abc123

2. URL 变更时,使用 GET 提交单条 URL:
   https://api.indexnow.org/IndexNow?url=https://example.com/page&key=abc123

   或使用 POST 批量提交,单批最多 10,000 条:
   POST https://<participating-engine>/indexnow
   Content-Type: application/json
   { "host": "example.com",
     "key": "abc123",
     "urlList": ["https://example.com/page1", "https://example.com/page2"] }

3. 接收方会自动将这次提交转发给其他 IndexNow 参与方
   (Bing → Yandex → Naver → Seznam → Yep)。
   只需推送一次,五家都会收到。

完整的 JSON 格式与各引擎的接口列表见 官方规范。包括 Cloudflare 在内的 CDN 都提供一键启用功能,可代站点推送 IndexNow(Cloudflare,2021);因此,许多站点即使没有自行编写代码,也已经在发送 IndexNow 通知。

Google 与 IndexNow 的关系还需单独说明。Google 在 2021 年 11 月宣布以可持续性为目标测试这套协议(Search Engine Land,2021-11-09),但测试并未带来正式采纳;到 2024 年,独立报道仍得出相同结论(ppc.land,2024-12-30)。实际结论很明确:一次 IndexNow 推送会通知 Bing、Yandex、Naver、Seznam、Yep;这些搜索索引中,目前只有 Bing 的数据会进一步用于 AI 答案,由 Bing Copilot 使用。

3. 各 AI 引擎受到什么影响:对照表

判断标准只有一个:这家 AI 引擎是否使用了支持这些协议的传统搜索索引。按此可以把引擎分为三类。

AI 引擎sitemap.xmlIndexNow为什么
Google AI Overviews使用(通过 Google 索引)不使用,因为 Google 没有加入 IndexNowAIO 的采信建立在 Google 经典网页索引之上;通过 Search Console 提交 sitemap 有助于 Google 更快发现页面,页面也随之有机会成为 AIO 的候选来源
Bing Copilot使用(通过 Bing 索引)使用(通过 Bing 索引)IndexNow 是 Microsoft 主推的协议;Copilot 使用 Bing 索引,因此一次推送可让 Bing 在数分钟内更新索引,Copilot 可用的候选来源也会同步更新
ChatGPT Search · Perplexity · Claude间接帮助发现:三家各自运行独立的检索爬虫,抓取节奏也各不相同;robots.txt 中的 Sitemap: 指令可能有助于发现页面,但并非必需不使用:三家公开的爬虫文档均未提到 IndexNow 或任何 URL 提交协议每家都维护独立的检索索引,也都没有对外提供 URL 提交通道

正确理解这张表的关键是:只有当 AI 引擎使用了支持这些协议的传统搜索索引时,提交协议才会发挥作用。Google AI Overviews 使用 Google 索引中的 sitemap 信息;Bing Copilot 同时使用 Bing 索引中的 sitemap 与 IndexNow 信息;独立答案引擎则依靠自己的爬虫,不使用这两项提交信息。因此,认为「推送 IndexNow 就能让 ChatGPT 引用我」,是混淆了两类引擎的工作方式(详见 §6)。

4. 向 AI 索引提交 URL:能做什么,不能做什么

从业者最常提出的问题是:如何把 URL 提交给 ChatGPT、Perplexity 或 Claude?截至 2026-05,答案是:无法直接提交。任何一家主流的独立答案引擎都没有第一方的 URL 提交通道。

目前可用的提交通道(均先提交到传统搜索索引,再间接影响 AI 答案):

  • Google Search Console:通过 sitemap 提交与 URL Inspection 将内容提交到 Google 经典网页索引,AI Overviews 直接使用这套索引(Build and submit a sitemap)
  • Bing Webmaster Tools:通过 sitemap 提交与 URL Submit 将内容提交到 Bing 索引,Bing Copilot 直接使用这套索引
  • IndexNow:推送通知可让 Bing、Yandex、Naver、Seznam、Yep 的索引在数分钟内更新;其中 Bing 索引的数据还会用于 Copilot,这是目前延迟最低的方式(How to add IndexNow)

不存在的提交通道:

  • OpenAI、Anthropic、Perplexity 三家都没有第一方的 URL 提交 API;三家的爬虫文档说明的都是 robots.txt、IP 段白名单和访问策略,均未说明如何提交 URL(OpenAI;Anthropic;Perplexity)
  • 「Google 接受 IndexNow」是一种常见误解,Google 至今没有加入这套协议
  • 也不存在任何一种可以一次向所有 AI 答案系统提交 URL 的统一通道

简而言之,目前无法把 URL 直接「提交给 AI」,只能提交到传统搜索索引,再由使用这些索引的 AI 答案系统获取。至于 ChatGPT 或 Perplexity 能否发现页面,关键不在于把 URL 提交到某个地方,而在于两个基础条件:页面内容便于检索爬虫读取后直接采用(可引用性),并且爬虫确实能够访问页面(AI 爬虫)。

5. sitemap.xml ≠ llms.txt ≠ robots.txt:三个文件,三种用途

完整的爬虫访问与内容发现配置通常包含三个站点根目录文件,但三者经常被混淆。每个文件各有明确用途,不能相互替代。

文件作用不具备的功能
robots.txt访问控制:决定爬虫能否抓取指定 URL它不列出 URL,不传达内容新鲜度,也不声明清单是否完整
sitemap.xml页面发现与清单完整性:列出希望被索引的全部页面它不负责精选内容,不授予访问权限,也不能作为质量信号
llms.txt精选内容与简洁排版:列出建议优先阅读的页面,并采用简洁的 Markdown 排版它既不授予也不拒绝访问,不声明清单是否完整,也不传达索引意图

sitemap.xml 不是精选清单,不是访问规则,也不是「最佳页面」目录,而是一份完整的 URL 清单。 如果只把筛选后的页面写入 sitemap.xml,就违背了这项协议的用途:精选内容应使用 llms.txt;sitemap.xml 则必须包含希望被索引的全部内容,缺失的 URL 会被引擎视为覆盖不足。llms.txt §4 从 llms.txt 的角度给出了同一组对照,可结合阅读。

6. 反模式:提交什么时候会适得其反或毫无作用

下面几种做法乍看合理,实际问题各不相同:有的误解了协议覆盖范围,有的弄错了参与方,还有的混淆了文件用途。

反模式看似合理的理由实际问题
「推送 IndexNow 之后,页面就会出现在 ChatGPT、Perplexity 或者 Claude 里」IndexNow 是开放标准,有些 AI 厂商也表示会遵守 Web 标准IndexNow 的参与方名单(indexnow.org)只有 Bing、Yandex、Naver、Seznam、Yep,并不包括任何 AI 厂商的爬虫。IndexNow 只能先通知 Bing,再通过 Bing 索引间接影响 Copilot
「只在 sitemap.xml 中列出优质页面,供 AI 引擎查看」GEO 强调精选内容,因此页面越少、质量越高似乎越合适这种做法违背了 sitemap.xml 的用途。这项协议要求清单保持完整,希望被索引的 URL 都应列入。引擎会把筛选后的子集视为覆盖不完整,而不是质量信号。精选内容应使用 llms.txt
「在 sitemap.xml 中加入 noindex 或 canonical 指向别处的 URL;列入的 URL 越多越好」直觉上看,列出的 URL 越多,发现范围似乎就越广sitemap 与页面信号不一致,会干扰引擎对页面质量的判断。Google 的 sitemap 文档明确说明了哪些 URL 应当列入、哪些不应列入(Build and submit a sitemap)
「尝试向 Google 推送 IndexNow,即使无效也不会造成损失」推送速度通常快于拉取,因此即使无效,似乎也不会造成损失自 2021 年那次测试公告之后,Google 一直没有加入 IndexNow(Search Engine Land,2021;到 2024 年,独立报道仍是同一判断 ppc.land)。这种提交没有接收方,却会在监控面板中制造噪声。向 Google 提交 URL 只能使用 Search Console

URL 提交是 GEO 的基础工作,但不是决定引用的关键。 它让页面有机会进入传统搜索索引;页面是否会进一步成为 AI 答案的候选来源,则取决于具体引擎。真正影响页面最终能否被引用的因素包括:可引用性、E-E-A-T、实体识别。如果在提交上投入过多,例如反复筛选 sitemap,或向未参与协议的引擎推送 IndexNow,并不会增加引用;投入不足,页面甚至可能没有机会成为候选来源。正确完成即可,无需反复优化。

7. 对 GEO 有什么影响,应该怎么做

你的需求建议做法
让 Google 发现我的站点,使页面有机会成为 AIO 的候选来源通过 Google Search Console 提交 sitemap(Build and submit a sitemap),并在 robots.txt 中添加 Sitemap: 指令
让 Bing 发现我的站点,使页面有机会成为 Copilot 的候选来源通过 Bing Webmaster Tools 提交 sitemap,并接入 IndexNow(How to add IndexNow)
让 Bing 在数分钟内发现新 URL,并供 Copilot 使用按 indexnow.org/documentation 接入 IndexNow;最简调用方式见 §2
让 ChatGPT、Perplexity 或者 Claude 引用我目前没有提交通道,应提高内容的 可引用性,同时确保检索爬虫能够访问页面(见 AI 爬虫)
在一次 GEO 整体审计中同时检查索引覆盖与爬虫访问GEO 审计 会分别检查 sitemap 是否存在、爬虫能否访问页面
让爬虫访问页面后能够正确解析内容SSR for AI Crawlers:这属于渲染问题,需要单独处理
在协议层面管控爬虫访问具体配置见 AI 爬虫 与 robots.txt
区分 sitemap.xml、llms.txt、robots.txt见上文 §5;llms.txt §4 也从 llms.txt 的角度对照了这三个文件

sitemap.xml 是 GEO 必不可少的基础配置;IndexNow 成本很低,对于通过 Bing Copilot 获得的 AI 曝光也值得启用。 两者都不是 GEO 中决定引用的关键;进一步投入的重点仍是 可引用性、E-E-A-T、实体识别。完善索引提交后,应把额外资源用于真正影响引用的环节。

参考资料

一手来源(协议规范):

一手来源(引擎文档):

一手来源(历史记录):

二手来源(独立报道与基础设施):

常见问题

提交 sitemap 或推送 IndexNow,能让我的页面被 AI 搜索引擎引用吗?
只能间接提高被引用的可能性,而且只适用于使用传统搜索索引的 AI 引擎。提交 sitemap 让 Google 将页面纳入索引后,页面才可能成为 Google AI Overviews 的候选来源;提交 sitemap 或推送 IndexNow 让 Bing 将页面纳入索引后,页面才可能成为 Bing Copilot 的候选来源。ChatGPT Search、Perplexity、Claude 各自运行独立的检索爬虫,抓取节奏也各不相同;三家公开的爬虫文档都没有提到读取 sitemap.xml 或 IndexNow(OpenAI;Anthropic;Perplexity)。提交只能让引擎有机会把页面列为候选来源,并不能保证页面会被引用。
Google 现在接受 IndexNow 提交吗?
截至 2026-05,不接受。Google 在 2021 年 11 月宣布测试这套协议(Search Engine Land),但此后一直没有正式加入;到 2024 年,独立报道仍得出相同结论(ppc.land,2024-12-30)。目前向 Google 提交 URL,仍要使用 robots.txt 中的 Sitemap: 指令、Search Console 的 sitemap 提交功能或 URL Inspection;此外还有用途很窄的 Indexing API,仅接收招聘启事和直播内容。
ChatGPT Search、Perplexity、Claude 会读 sitemap.xml 或 IndexNow 吗?
三家的爬虫文档都没有说明会读取这两份文件。OpenAI、Anthropic、Perplexity 的公开爬虫页面只介绍 robots.txt、IP 段白名单和访问策略,没有提到 URL 提交。它们的检索爬虫会按自己的节奏发现页面,因此真正该做的是确保爬虫能够访问页面(AI 爬虫),并让页面内容便于直接采用(可引用性),而不是寻找并不存在的提交协议。
可以只在 sitemap.xml 中列出优质页面,供 AI 引擎查看吗?
不能,这不符合协议的用途。sitemap.xml 是一份完整的 URL 清单,你希望被索引的全部 URL 都应列入同一份规范文件。引擎会把筛选后的子集视为覆盖不完整,而不是质量信号;Google 的 sitemap 文档也明确说明了哪些 URL 应当列入、哪些不应列入(Build and submit a sitemap)。精选内容应使用 llms.txt,访问控制应使用 robots.txt;sitemap.xml 表达的是「我希望被索引的内容全部在这里」。
目前该如何向 AI 引擎提交 URL?
任何一家主流的独立答案引擎都没有第一方的「提交给 AI」通道。可行的办法只有先提交到传统搜索索引,再由使用该索引的 AI 答案系统间接获取页面。现有方式分为两组:Google Search Console(对应 AIO),以及 Bing Webmaster Tools 或 IndexNow(对应 Copilot)。对于 ChatGPT、Perplexity、Claude,更基础的工作是正确设置 robots 策略,让检索爬虫访问页面时获得可正常解析的 SSR 响应(SSR for AI Crawlers),并让页面内容便于直接采用(可引用性)。

延伸阅读

参考来源

一手来源

  1. Sitemaps XML format — Protocol · sitemaps.org
  2. IndexNow — Documentation · indexnow.org
  3. IndexNow — homepage (participating engines) · indexnow.org
  4. How to add IndexNow to your website (Bing Webmaster Tools) · Microsoft Bing
  5. Build and submit a sitemap · Google Search Central · 2025-12-10
  6. Bing Webmaster Guidelines · Microsoft Bing
  7. Overview of OpenAI Crawlers (GPTBot / OAI-SearchBot / ChatGPT-User) · OpenAI
  8. Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic · 2026-04-07
  9. Perplexity Crawlers · Perplexity AI
  10. Google is testing the IndexNow protocol for sustainability · Search Engine Land · 2021-11-09

二手来源

  1. Google's absence from IndexNow raises questions about web indexing standards · ppc.land
  2. Cloudflare now supports IndexNow · Cloudflare
  3. IndexNow — new initiative by Microsoft and Yandex to push content to search engines · Search Engine Land
最近更新: 2026-05-23 作者: Ray Yang 主题: 基础设施