跳到正文

GEO 成熟度模型

速览要点

难度
进阶
预计耗时
首次组织团队评估约需半天,复评约需 1 小时
前置条件
GEO 审计、GEO 指标
这是什么
一套五级能力模型,分五个维度打分:先确定现状,再集中满足下一级条件,然后复评
打分规则
等级取五个维度里的最低分,绝不取平均分
是行业通行说法吗
这类模型确实存在:Webflow、Semrush、Superlines 都发布过,但等级数量和命名没有形成共识。本条目采用的 5 × 5 网格和取最小值规则出自 GEO Wiki
由谁发布
目前的发布者都是平台厂商和代理商。截至 2026 年 8 月,Gartner、Forrester、麦肯锡等分析机构都没有发布 GEO 或 AEO 成熟度模型
投入
首次组织团队评估约需半天,复评约需 1 小时

1. 一次 GEO 成熟度评估要回答什么

成熟度评估要回答的问题,比看上去更具体。它不是在问「我们的 GEO 做得怎么样」(这种问法无法得到可执行的答案),而是:接下来最值得建设哪项能力,以及怎样才算达标。成熟度等级只有配上明确的达标条件,才真正有用。

所以,这里给出的是等级,不是分数。用一个 0 到 100 的就绪度数字概括几项彼此独立的能力,会掩盖真正制约整体表现的那一项。基于同样的道理,GEO 指标 不把厂商的复合分数当作结论,完整 GEO 审计 也只把综合分作为次要参考。

审计和追踪为这套评估提供两类不同的依据。审计记录站点在某一时点的状况,并按严重程度排序;AI 引用追踪 则持续反映引擎的实际表现。这套评估把两类信息结合起来,每次集中满足一项升级条件。

成熟度模型由来已久。 它源于 CMMI,其官方模型列出 0 到 5 共六个等级:Incomplete、Initial、Managed、Defined、Quantitatively Managed、Optimizing(见 CMMI Institute)。商业领域也已经开始采用 GEO 成熟度模型:Webflow 发布过按四个类别 × 五个等级设计的 AEO 成熟度模型,Semrush 在 Adobe Summit 上推出了四阶段的 People and Process Maturity Matrix(见官方消息),Superlines 也有一套四阶段 GEO 成熟度框架

这类模型目前有两个明显特点。第一,这类模型还没有统一标准:已发布的模型有的分四级,有的分五级,等级名称也完全不同。Webflow 的五级分别是 Keywords、Answers、Structure、Pillar、Authority,Superlines 的四级则是 Ad Hoc、Emerging、Integrated、AI-First。第二,目前的发布者都是平台厂商和代理商,分析机构还没有推出同类模型。Forrester 出过一份 AEO 打法指南,但没有提出成熟度模型;专门提供 AI 可见度工具的厂商也都没有发布同类模型。在公开模型中,Webflow 的类别 × 等级网格与本条目最接近。本条目的区别在于增加了归属与节奏这个维度,以及取最小值而非平均值的规则;这套模型重在实际使用,不是行业公认标准。

2. 五个维度:等级取最小值,不取平均值

只沿一个维度划分等级,实质上仍是一张清单。这里采用五个维度,其中四个直接对应 GEO 审计 的某一层,另一个不在审计范围内:

#维度对应的审计层这项能力是什么
D1访问与交付第 1 至 2 层引擎能抓取页面,渲染后仍能读取主体内容
D2结构与内容第 3 至 4 层机器能解析抓取到的内容,而且内容值得引用
D3站外权威第 5 层实体在自有域名之外得到印证
D4度量第 6 层能掌握引擎的实际表现,观测结果也可复现
D5归属与节奏有明确负责人,工作按固定周期开展,并有预算支持

D5 沿用了 CMMI 的思路,正是这个维度让本模型区别于一般的行动清单。 能力建设最难的一步,是把一次性项目变成固定流程,而任何审计层都无法衡量这一点。早在 AI 出现之前,SEO 领域也有同样的认识。Heather Physioc 提出的组织层面的搜索成熟度阶段,从「初始、临时起意」一直到「高效、持续优化」,沿用了 CMMI 的基本结构,只是换成搜索领域的用语。Martijn Scheijbeler 的 SEO Maturity Curve 则采用另一种划分方式,从技术、内容、权威、支持和策略几个方面评估成熟度,而不是只按一个维度排列等级。

规则如下:你所处的等级取五个维度里的最低分,不取平均分。 原因和审计一样:前一项能力是后一项生效的基础。D1 只有 1 分、D2 却有 4 分,表示内容虽然写得很好,引擎却从未抓取。平均分或许更适合展示在厂商看板上,但真正能预测引用率的是最低分。

这条规则看似严格,但也要看到另一面:团队在其他维度完成的工作,都已经积累下来,不会作废,制约因素消除后就能发挥作用。一个内容质量很高、页面却无法被爬虫访问的团队,并没有浪费这个季度,只是提前完成了原本要在修改 robots.txt 后开展的内容工作。

3. 五个等级速览

等级名称一句话概括达标条件(可判定)
L1无人管理没有人负责,没有基线,引擎往往根本无法抓取AI 用户代理能够抓取页面,并且渲染后仍有主体内容;由一名具体负责人承担这项工作
L2已可观测能观测自身表现:提问集和基线已有记录,方法可以重复执行第二轮度量能按照书面方法复现第一轮结果
L3成体系内容和结构优化按固定节奏开展,不再依赖单个项目复审前后的数据差异中,至少有一项变化能归因于你所做的某项改动
L4参与竞争已确定竞品集,开始调优单个引擎,并持续开展站外权威建设引用份额(Citation Share)在事先确定的竞品集里连续两个周期持平或上升
L5成为参照引擎会优先引用你的内容,你也成为定义品类的来源核心话题在三个以上引擎中稳定获得首位引用,且方法公开

每一级都有一个可以判定为不通过的条件。如果永远无法判定某个等级不通过,它就只是一句口号。多数已发布的成熟度模型无法用来解决分歧,症结正在于此。

4. 5 × 5 评估表:先给自己定位

维度L1 无人管理L2 已可观测L3 成体系L4 参与竞争L5 成为参照
D1 访问与交付站点拦截 AI 用户代理,或访问状态从未检查;主体内容依赖客户端渲染已核实用户代理;主体内容位于服务端 HTML 中每次发布时都重新检查访问与渲染已掌握各引擎的抓取行为,并会据此作出调整每次基础设施改动,都先通过 AI 抓取测试再发布
D2 结构与内容没有结构化数据;正文无法划分出独立内容块关键模板已有结构化数据(Schema);完成过一次内容块审查可引用性标准已纳入写作流程;按固定频率更新内容按查询意图调整内容覆盖范围;参照竞品补足缺失内容引擎谈到这一话题时会优先引用你的内容
D3 站外权威引擎无法解析实体;没有监测提及已统计品牌提及;了解品牌在知识图谱中的状态有明确负责人持续争取品牌提及针对事先确定的竞品集追踪声量份额第三方把你作为该领域的定义来源引用
D4 度量没有提问集,没有基线已有提问集、基线和书面方法变化量能归因于某项具体改动能够分别按竞品和引擎分析数据方法已经公开,他人可以复现
D5 归属与节奏没有人负责责任落实到个人;执行频率尚不固定每季度审计、每月追踪,并有预算支持工程、内容、公关协同推进,相关工作已纳入路线图制定路线图时会考虑 GEO 的要求

填表规则:每一格都要有带日期的证据,不能凭印象判断。「我觉得我们的结构化数据没问题」不能作为 D2 的依据,带日期的 Rich Results Test 记录才可以。只有这样,复评才能采用与首次评估相同的尺度,两次结果才有比较意义。

已有的审计结果可以直接使用。按严重程度排序的发现可以归入 D1 至 D4,而且这里没有折中的余地:第 1 层只要出现一条阻断级发现,D1 就只能判为 L1,其他维度得分再高也不影响这一结论。

5. 逐级拆解

下面每一级都按相同的五部分说明:当前状态、唯一的达标条件、按优先级排列的行动、需要关注的指标,以及最常见的失误。

5.1 L1 无人管理

你在这一级,如果没有人清楚 robots.txt 对各 AI 用户代理是放行还是拦截;主体内容依赖客户端渲染;没有任何人负责这项工作
达标条件AI 用户代理能够抓取页面,并且主体内容出现在服务端 HTML 中;指定一名负责人,把责任落实到个人
优先动作(1)检查爬虫访问,见 AI 爬虫访问审计;(2)将主体内容改为服务端渲染,见 面向 AI 爬虫的 SSR;(3)指定一位负责人,并书面记录
指标来源多样性得分(Source Diversity Score)、提及频次(Mention Frequency)。这两项指标只看有无,不设竞品集

各用户代理令牌在 robots.txt 中的处理方式,见 Google 常见爬虫清单;具体对照见 AI 爬虫

这一级最常见的失误:引擎还无法抓取页面,就先购买监测订阅。 团队每月支付订阅费,数据始终为零,但看板仍让人误以为工作已有进展。

5.2 L2 已可观测

你在这一级,如果有人问起「我们的引用率(Citation Rate)是多少」,你能给出具体数字,并且能说明计算方法;提问集有书面记录,不只存在于某个人的记忆中
达标条件第二轮度量能够按照书面方法复现第一轮结果
优先动作(1)建立追踪机制,见 AI 引用追踪;(2)写明引擎集和时间窗;(3)完成首次完整 GEO 审计;(4)打好结构化数据基础,见 Schema 实施
指标加入引用率和平均位置(Average Position),并采用定义 A,即引用顺序(见 GEO 指标

采用哪一种平均位置定义,本身就是达标条件的一部分,不是可以略过的细节:同一个品牌按引用顺序、提及顺序或列表位置计算,得分会完全不同。还有两项因素会使早期数据失真。第一,AI 带来的会话很难在常规分析工具中准确归因(见 AI 搜索归因);第二,选择统计提及还是统计引用,可能让同一项数据相差两三倍(见 引用 vs 提及 vs 链接)。各家厂商的算法也不一样。Otterly 完整公开了自己的 KPI 定义,可以拿来对照那些定义不公开的工具。

这一级最常见的失误:测量越做越多,却没有任何改进行动。 追踪更多引擎和提问词看似取得了进展,却无法提升成熟度等级。

5.3 L3 成体系

你在这一级,如果可引用性标准已经纳入写作流程,不再依赖一次性的集中清理;确实有人按固定频率完成复审
达标条件复审前后的数据差异中,至少有一项变化能归因于你所做的某项改动
优先动作(1)把抽取质量纳入常规工作,见 可引用性审计面向 AI 引用的写作;(2)确定内容更新频率,见 内容新鲜度;(3)发布并维护 llms.txt;(4)为固定节奏安排预算:每季度审计,每月追踪
指标加入答案纳入率(Answer Inclusion Rate),即事先确定的提问集覆盖度。仍然不设竞品集

与这一级相关的因果证据最充分。改写内容时加入引文、统计数据和引述,最多可使内容在答案中的呈现度提升约 40%,见 Aggarwal et al. 2024arXiv:2311.09735);不过,这项提升是在只有一方进行优化的条件下测得的。

这些改写的先后顺序也很重要。这份行动清单把相关性放在其他优化之前,依据是 Wan et al. 2024arXiv:2402.11782)。研究者让模型在两篇相互矛盾的页面之间做出选择,结果显示,内容与问题的相关程度起主导作用;科学文献引用、中立语气、规范引用格式等人类读者重视的外在可信度信号,几乎没有改变模型的偏好。这篇论文只说明了效果方向,没有给出精确幅度,因此可用于确定先后顺序,不能用于确定具体数值。

这一级最常见的失误:没有比较复审前后的数据就宣布见效,或者把引擎自身的变化算作团队的成果。一旦有人要求查看前后数据,这两种说法都无法成立。

5.4 L4 参与竞争

你在这一级,如果竞品集已经确定;各引擎之间的差异已经得到实际测量的证实,而非出自猜测;站外权威建设有专人负责
达标条件引用份额在事先确定的竞品集里连续两个周期持平或上升
优先动作(1)持续建设站外权威,见 品牌提及追踪,相关概念见 品牌提及实体识别;(2)按各引擎的差异分别调优,见 Perplexity AIChatGPT SearchGoogle AI Overviews;(3)按行业采用相应做法,见 SaaS / B2B电商媒体
指标加入引用份额、声量份额、首位引用率(First-Cite Rate)、品牌情感(Brand Sentiment)

解读竞品相对指标,必须先看算法。Ahrefs 计算声量份额时按搜索量加权,用来估算曝光(见 Brand Radar 方法说明),多数厂商采用的却是原始提及次数,因此两项同为声量份额的指标通常不可直接比较。能否计算首位引用率,取决于引擎是否公开引用顺序:Perplexity 的 API 会按顺序返回引用数组,另外几家则不会。

这一级最常见的失误:把大量精力花在只对某个引擎有效的调优上,以及把相对于竞品的结论和绝对结论放在同一栏里,当作同类数据。

5.5 L5 成为参照

你在这一级,如果第三方把你作为该领域的定义来源引用;产品和内容路线图会提前考虑 GEO 的要求,而不是事后补救
达标条件核心话题在三个以上引擎中稳定获得首位引用,且方法公开
优先动作(1)公开度量方法,使他人能够复现;(2)防范检索或模型更新使现有引用位置全部丢失;(3)维持 E-E-A-T 信号,正是这些信号让实体成为默认来源
指标启用全部十项指标,再加入自定义复合指标,但只有到了这一级才能加入:各项输入都单独追踪、加权方式也已公开后,复合指标才可信

另外,Google 明确说明,AI 功能不需要任何专门的结构化数据(见 AI features and your site)。因此到了这一级,结构化数据的价值在于清楚说明实体,不能将其视为准入条件。

这一级最常见的失误:以为当前的引用地位能够长期保持。 一次检索或模型更新就可能让已有成果全部消失。第 5 级需要反复争取,不是达到后就能一直维持。

6. 每道关卡要花多久、花多少:真正需要等待的是什么

下面的时长重在说明背后的机制,不是日历上的具体排期。这张表从另一个角度呈现 GEO ROI 模型 中的回报曲线,按等级提升来区分,不按月份划分。

等级提升需要多久真正需要等待什么对应哪种价值
L1 → L2几天到几周修复访问或渲染问题后,等待爬虫重新抓取,再完成一轮基线测量技术基础(0 至 30 天)
L2 → L31 至 2 个季度完成两轮可比的度量,并实施一项能够解释变化的改动引用价值(30 至 120 天)
L3 → L42 至 4 个季度等待内容重新获得采信,并形成一个足够稳定、可供比较的竞品集替代流量价值(60 至 180 天)
L4 → L54 个季度以上,而且往往始终无法达到等待站外提及逐渐影响模型对实体的既有认知品牌权威价值(180 至 540 天)

成本方面,GEO ROI 模型 已把一次性投入、持续投入和几乎从不单独列出的内部隐性投入分开说明,并给出工具的价格区间。向管理层汇报任何数字前,都要先到厂商官网核对当前价格:这个市场变化很快,任何已经发布的价格区间都会很快过时。

成熟度等级也会下降。Ahrefs 对 1,700 万次引用的分析 发现,平均而言,被 AI 引用的内容比 Google 自然搜索结果中的内容新 25.7%。要持续保持这种新鲜度,就不能停止更新;所以 L3 把固定更新频率列为必要条件,不是额外加分项。这项要求究竟有多高,以及它为什么没有想象中那么难,见 内容新鲜度

7. 排序规则:在你这个等级上不该做什么

四条规则分别对应一个具体等级:

  1. 第 4 级之前不做单引擎调优。 在能够稳定测出各引擎差异之前,可抓取、可渲染、结构清楚、内容值得引用、实体获得站外印证,这些基础工作对每个引擎都同样有效。只有具备稳定测量差异的能力后,研究和调整单个引擎才值得投入。
  2. 第 4 级之前不用竞品相对指标。 竞品集不稳定、引擎集未明确时,算出的声量份额只是一个由分母决定的数字。
  3. 第 5 级之前不出复合分数,到了第 5 级也必须同时公开加权方式,这与 GEO 指标GEO 审计 的规则一致。
  4. 第 3 级之前不参考行业条目。 只有内容体系建立起来后,各行业的做法才开始出现差异;在此之前,SaaS、电商、媒体需要做的事几乎完全相同。

这四条都针对同一个失误,而这也是这个领域最浪费时间的做法:团队汇报的往往是已经表现良好的指标,而不是有助于满足下一级条件的指标。第 2 级团队报告声量份额,并不说明目标远大,只是在报告一个自己还无法解读的数字。

8. 在哪里可以主动停下

第 5 级不应成为绝大多数组织的目标。 目标定在哪一级,要根据业务情况判断。GEO ROI 模型 列出了五种投入难以获得回报的情形:需求量极小的细分领域、由平台货架主导的标准化商品、完全依靠投放或产品驱动的获客模式、关系型销售(增长瓶颈在产能,而非曝光),以及尚未验证产品市场契合度的阶段。

对多数中型 B2B 公司来说,第 3 级就是合理的终点。 第 4 级需要单独立项并安排预算,并不是理所当然的下一步;停在第 3 级也不意味着失败。

这套模型无法回答以下三个问题,提交董事会前需要先说明:

  • 你无法控制的引擎变化。 一次检索更新对数据的影响,可能大于团队一个季度的工作成果。
  • 品类本身的上限。 有些品类天然会把流量导向平台和聚合站,无论达到哪个成熟度等级,都无法改变这一点。
  • 竞品涨幅来自自身行动,还是引擎变化。 相对变化可能有这两种成因,而数据往往无法区分。

对厂商的「AI 成熟度分数」和复合指标,应采用同一条规则:可以提及,但不为其背书;算法不公开,就无法解读(见 GEO 指标)。还要注意,多数已发布的成熟度模型,包括 §1 引用的几个模型,本身就是附有自评入口的获客材料。这不意味着它们的结论一定错误,但它们给出的等级往往恰好略低于自家产品主要面向的成熟度阶段。

9. 评估交付物与复评节奏

每一次评估都要交付以下内容:

  • 填好的 5 × 5 评估表,每一格都有带日期的证据。
  • 等级结论:列出最低分和五个维度各自的分数,格式如 L1 — D1:3 D2:2 D3:1 D4:2 D5:2。将这组分数与总等级一并公布,才不会用一个看似理想的数字掩盖各维度的差异。
  • 下一级的达标条件,照 §3 原文填写。
  • 满足该条件的行动清单,按影响 × 把握 × 难易重新排序。
  • 复评日期。

每季度复评一次;遇到以下事件时,另行审计(见 GEO 审计):站点迁移、渲染方式改动、robots.txt 变更、大批内容上线,或者已知的引擎更新。

如果一次复评的各项结果都没有变化,这本身也是一个结论。它说明本季度的工作没有提升当前制约整体等级的那项能力;与一个波动原因不明的数字相比,这个结论更值得关注。

10. 延伸阅读

常见问题

「GEO 成熟度模型」是行业公认的框架,还是 GEO Wiki 自行提出的?
这类模型已有多个公开版本。Webflow 发布过按四个类别 × 五个等级设计的 AEO 成熟度模型;Semrush 推出过四阶段的 People and Process Maturity Matrix;Superlines 也有一套四阶段 GEO 成熟度框架。但这些模型没有形成共识:有的分四级,有的分五级,等级名称也各不相同,分析机构也没有发布同类模型。因此,GEO 成熟度模型已经有人使用,但还不是行业标准。本条目的五维网格和取最小值规则,是 GEO Wiki 自行梳理的结果。
我们的内容做得很好,但 AI 爬虫无法访问,算第几级?
第 1 级。等级取五个维度里的最低分,不取平均分,因为这些维度有先后依赖关系:如果引擎根本抓不到内容,内容写得再好也不可能获得引用。这条规则看似严格,但已经完成的内容并没有白费;访问问题解决后,这些内容就能开始发挥作用,而这类问题通常几天到几周即可修复。修复访问问题后,你可能一次升两级。
我们到底应该以哪一级为目标?
对多数中型 B2B 公司来说,第 3 级就是合理的终点;第 4 级需要单独立项和预算,并不是理所当然的下一步。第 5 级不应成为绝大多数组织的目标:能达到这一级的组织极少,成本也高,而且每次模型或检索更新后都要重新争取。目标定在哪一级,要根据业务情况判断。GEO ROI 模型列出的几种情形,说明了哪些组织适合停在第 1 级,只做好技术基础。
什么时候该开始针对单个引擎做优化?
第 4 级之前都不该开始。在你能稳定测出各引擎之间的差异之前,可抓取、可渲染、结构清楚、内容值得引用、实体获得站外印证,这些基础工作对每个引擎都同样有效;此时做单引擎调优,只是让猜测显得精确。只有具备稳定测量差异的能力后,研究和调整单个引擎才值得投入。竞品相对指标也是同理:竞品集和引擎集还不稳定时,算出的声量份额(Share of Voice)只是一个由分母决定的数字。
这和做一次 GEO 审计有什么不一样?
审计给出一份按严重程度排序的发现清单,反映站点当时的状况。这套模型根据审计发现设定各阶段的能力建设目标,每次集中满足一项升级条件,同时补上审计没有覆盖的维度:是否有人负责、按什么频率执行、是否有预算。实际使用时,审计就是模型的输入:审计发现可以直接归入五个维度中的四个;第 1 层一旦出现阻断级问题,无论其他维度得分多高,整体都只能判为第 1 级。
能不能跳级?
如果眼下的问题容易解决,一个周期内连升两级是可能的:修复访问问题,再完成第一轮基线测量,一个季度内从第 1 级升到第 2 级完全可行。真正不能跳过的是度量维度。第 2 级以上的各项达标条件都要看变化量,而且变化必须能归因于团队所做的某项改动;没有可复现的基线,就无法比较前后差异。跳过度量的团队,最后只能笼统地声称「我们做出成绩了」,既说不清,也经不起验证。

相关指南与百科

参考来源

一手来源

  1. CMMI Levels of Capability and Performance · CMMI Institute / ISACA
  2. GEO: Generative Engine Optimization (Aggarwal et al., KDD 2024) · arXiv / KDD '24 · 2024-08-25
  3. GEO: Generative Engine Optimization (KDD '24 Proceedings) · ACM SIGKDD · 2024-08-25
  4. What Evidence Do Language Models Find Convincing? (Wan et al., ACL 2024) · arXiv / ACL 2024 · 2024-02-19
  5. What Evidence Do Language Models Find Convincing? (ACL Anthology) · Association for Computational Linguistics · 2024-08-11
  6. Otterly.ai — Brand Report KPI Definitions · Otterly.ai
  7. Ahrefs Brand Radar Methodology · Ahrefs
  8. Perplexity API — Chat Completions Reference · Perplexity
  9. List of Google's common crawlers (Googlebot, Google-Extended) · Google Search Central · 2026-04-23
  10. Google Search Central — AI features and your site · Google · 2025-12-10

二手来源

  1. Announcing Webflow's AEO Maturity Model · Webflow
  2. Semrush Unveils Brand Visibility Framework at Adobe Summit · Semrush
  3. The 4-Stage GEO Maturity Framework: How Ready Is Your Brand For AI Search? · Superlines
  4. Preparing Your Brand for AI-Driven Search with the AEO Maturity Model · SEO Hacker
  5. Win Visibility In AI Search With Answer Engine Optimization · Forrester
  6. SEO Maturity: How to Grow Search at Your Company · Page One Power (Heather Physioc)
  7. The SEO Maturity Curve: Where Does Your Strategy Stand? · Martijn Scheijbeler
  8. New Study: AI Assistants Prefer to Cite 'Fresher' Content · Ahrefs
最近更新: 2026-08-10 作者: Ray Yang 主题: 实践