GEO:生成式引擎优化(Aggarwal 等,2024)
速览要点
- 原文标题
- GEO: Generative Engine Optimization
- 作者
- Pranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit, Ashwin Kalyan, Karthik Narasimhan, Ameet Deshpande
- 发表信息
- KDD 2024 (Proc. 30th ACM SIGKDD)
- 年份
- 2024
- DOI
- 10.1145/3637528.3671900
- 链接
- https://arxiv.org/abs/2311.09735
- 可复现性
- 代码与数据均公开
- 证据基础
- GEO-bench:1 万条查询,25 个领域,9 个来源数据集
- 测试对象
- 内部 GPT-3.5 实验系统(使用 Google 前五条结果),以及线上引擎 Perplexity.ai
- 核心结论
- 可见度最高提升 40%,这是按方法与领域计算的上界;线上引擎中最高约为 22%
通俗摘要
Aggarwal 等人提出了一个当时全新的问题:如果 AI 搜索引擎直接写出答案,而不是罗列链接,应当怎样提高内容出现在答案中的机会?他们把这一问题定义为「生成式引擎优化」,构建了 GEO-bench(涵盖 25 个领域的 1 万条查询)作为评测基准,并测试了九种内容改写方法。结果显示:补充引用、统计数据和引述,能稳定提高页面在合成答案中的可见度,在论文的实验设置下最高可达 40%;关键词堆砌这种 SEO 常见做法则没有效果。
关键发现
- 按论文的 Position-Adjusted Word Count 指标计算,改写内容(补充引用、统计数据和引述)最高可使可见度提升约 40%。
- 「最高 40%」是特定方法、特定领域下的上界,并非平均效果;从业文章常忽略其适用范围,直接沿用这一醒目数字。
- 方法效果取决于领域与引擎:Cite Sources 在事实型查询中表现最好,Authoritative 在辩论与历史类查询中表现最好,Statistics Addition 在法律与观点类查询中表现最好。
- 关键词堆砌这种传统 SEO 做法没有帮助,甚至可能有害。这是早期证据,表明 GEO 并不只是给传统 SEO 手法换个名称。
- 排名靠后的页面收益最大(Cite Sources 使排在第 5 位的页面可见度提升 +115.1%),说明 GEO 在一定程度上削弱了搜索中原有位次带来的优势。
- 这些效果在对线上引擎 Perplexity.ai 的测试中仍然存在,最高增幅约为 22%,明显小于内部引擎,说明结论推广到其他环境时存在局限。
1. 这篇论文是什么,为什么它奠定了整个领域
生成式引擎优化这一领域的名称出自这篇论文。GEO: Generative Engine Optimization(Aggarwal et al., KDD 2024)是 GEO 一词的学术来源。
论文把一个含糊的从业者直觉(「让我的内容出现在 AI 答案中」)转化为可以度量的优化问题,同时提供了一套公开基准。
论文采用的是狭义定义,结论仅适用于它自己的基准:研究对象是在固定评测系统中改写内容。此后,从业者又用「GEO」指代整个学科,因此今天围绕这个词的多数说法,并未经过这篇论文验证。
2. 论文如何定义研究问题
论文从搜索结果形态的根本变化出发:结果页过去是一列排序链接,生成式引擎返回的却是单一合成答案。可见度(visibility)不再等同于排名。
论文有意把模型尽量简化:
- 生成式引擎是一个黑箱:内容创作者无法改动模型,只能改动作为输入的网页内容。
- 目标是尽可能提高内容在合成答案中的可见度,而不是提高它在链接列表中的排名。
- 优化能否奏效,取决于生成答案时如何使用页面文本。正因如此,论文没有沿用排名,而是另设了可见度指标(见 §4)。
论文的前提是存在检索(retrieval)与采信(grounding)机制,用来决定引擎选取哪些来源,以及怎样利用这些来源生成答案。相关机制见 answer loop,Gao et al. 2023 也对此做过综述。论文假定这套机制成立,并据此提出优化问题。
3. 方法学:GEO 框架与 GEO-bench
论文评估了九种内容优化方法,每一种方法都会以特定方式改写候选来源网页:
| # | 方法 | 一句话意图 |
|---|---|---|
| 1 | Authoritative | 以更具权威性的语气改写 |
| 2 | Statistics Addition | 补充相关的量化数据 |
| 3 | Keyword Stuffing | 增加查询关键词(SEO 常见做法) |
| 4 | Cite Sources | 增加对可信来源的引用 |
| 5 | Quotation Addition | 增加相关引述 |
| 6 | Easy-to-Understand | 简化语言 |
| 7 | Fluency Optimization | 提升流畅度 |
| 8 | Unique Words | 加入不常见或独特的词汇 |
| 9 | Technical Terms | 加入相关领域的技术术语 |
基准 GEO-bench 的构建方式:
- 1 万条查询,划分为 8K 训练、1K 验证、1K 测试。
- 取自 9 个数据集:MS MARCO、ORCAS-I、Natural Questions、AllSouls、LIMA、Davinci-Debate、Perplexity.ai Discover、ELI5,以及 GPT-4 生成的查询。
- 查询覆盖 25 个领域(如 Arts、Health、Games),并按七种方式归类。
- 每条查询附带其 Google 前 5 条结果,作为候选来源集。
实验测试了两个引擎:一个是内部搭建的生成式引擎(使用 GPT-3.5-turbo,以 Google 前 5 条结果为输入),另一个是已经上线的 Perplexity.ai,用于在线上环境中对照验证。
4. 可见度指标:后续研究最常沿用的一项贡献
后续工作反复沿用的,不是论文中的某种具体方法,而是它提出的指标。论文没有停留在判断 引用与提及 的有无,而是把可见度细化为连续且随位置变化的指标。
论文提出两种可见度指标:
Position-Adjusted Word Count (Imp_pwc):
对被引用句子 s 求和:|s| · e^(-pos(s)/|S|)
再除以回答总词数
= 被引用句子的词数,按句子在答案中
出现的早晚做指数衰减。
Subjective Impression:
由 GPT-3.5 在 7 个子维度上评分的综合指标:
相关性 · 影响力 · 独特性 · 主观位置 ·
主观计数 · 点击可能性 · 多样性
与「有没有被引用」这种是非判断相比,它衡量的是一个来源对答案的影响程度,而这正是 可引用性(citability) 要优化的对象。后来,多数厂商在设定 KPI 和 GEO 指标体系时,也沿用了按位置加权的思路。
5. 结果细节
下表列出论文的核心结果,同时标明它们的适用边界:
| 发现 | 细节 |
|---|---|
| 最高增幅 | GEO 方法在 Position-Adjusted Word Count 上最高可使可见度提升约 40% |
| 表现最佳的方法 | Quotation Addition +41%(PAWC);Statistics Addition +37%(Subjective);Cite Sources +30%(PAWC) |
| 不是平均值 | 「最高 40%」是按方法、按领域计算的上界,不能当作在所有情况下都能达到的预期增益 |
| 取决于领域 | Cite Sources 在事实型查询中表现最好;Authoritative 在辩论与历史类查询中表现最好;Statistics 在法律与观点类查询中表现最好 |
| 传统 SEO 做法失效 | Keyword Stuffing 没有帮助,而且可能有害 |
| 低位页面收益更大 | 排名第 5 的页面收益最大,Cite Sources 使其可见度提升 +115.1% |
| 线上引擎验证 | 在 Perplexity.ai 上最高提升约 22%,增幅小于内部引擎 |
把「传统 SEO 做法失效」和「线上引擎验证」两项放在一起,结论很明确:应当改进内容本身,不应依赖关键词技巧;同时要注意,这个百分比只是上限,并非通常可以达到的增幅。
6. GEO Wiki 评估
这篇论文有三项奠基性贡献,至今依然成立:
- 命名与界定。把「进入 AI 答案」转化为一个黑箱优化问题,为整个领域奠定了基础。
- 可见度指标。论文用连续且按位置加权的指标来衡量来源对答案的影响,这一思路后来被广泛沿用。
- 公开基准。GEO-bench 让研究结论可以检验,也为后续研究质疑这些结论提供了基础。
不过,这些结论也有四点局限:
- 外部效度有限。实验测试的是 2023–24 年的引擎形态,即一个内部 GPT-3.5 实验系统和 Perplexity.ai。今天的 ChatGPT Search、Gemini 与 Google AI Overviews 已采用不同的检索与合成方式,因此不能据此认定结论也适用于这些系统。
- 基准会随时间失效。GEO-bench 的语料与引擎都会老化。「40%」只反映 2024 年当时的实验结果,不能跨年份视为常数。
- 后续复现得出相反结果。Puerto 等人的 C-SEO Bench(NeurIPS 2025 Datasets & Benchmarks)发现,一旦多方针对同一引擎同时优化,许多对话式 SEO 改写就会失效,甚至适得其反。本论文测得的提升只反映单一参与者优化时的情形,是上界,并不代表多方博弈后的均衡。
- 醒目数字容易被误读。「最高 40%」在从业文章中常被简化为「约 40%」。准确的说法是:这是一个按方法、按领域计算的最大值,在线上引擎中已缩小到约 22%,还可能因竞争和可信度筛选(E-E-A-T)而进一步缩小。
GEO Wiki 的判断是:奠基不等于可以直接照搬。可以沿用的是论文指出的方向,即补充来源、统计数据和引述比操纵关键词更有效;具体增幅则不宜沿用,更不能把它当作规划依据。
7. 可复现性
以下状态在撰稿时(2026-05-17)逐项核实过,并非凭推测:
| 产出物 | 状态 |
|---|---|
| 源代码 | 公开:github.com/GEO-optim/GEO(run_geo.py、geo_functions.py) |
| 基准数据 | 公开:HuggingFace GEO-optim/geo-bench |
| 许可 | Apache-2.0 |
| 项目页 | generative-engines.com/GEO/ |
字段取值:code-and-data。方法实现与 GEO-bench 均已公开,因此论文中的主要实验可以独立复现。相对于这一领域的多数论文,这是一个明显的优势。
8. 它对从业者意味着什么
可以沿用的做法和需要避免的误区如下:
- 可以用:改进内容本身。补充可信的 引用、具体的统计数据和相关引述,这些做法经过反复验证,结论也相对稳定。
- 可以用:使用连续指标衡量可见度。持续追踪一个来源在答案中的显著程度,不要只记录是否被引用,并把这项指标纳入 AI 引用追踪。
- 不要用:具体百分比,以及任何跨引擎、跨领域的外推。同一处改写在 ChatGPT Search 与 Perplexity.ai 上的表现并不一致。
- 不要默认收益能够持续:单一参与者获得的收益,在竞争者也开始优化之后未必还能保持(见 §6,C-SEO Bench)。
9. 延伸阅读
- Gao et al. 2023 — RAG: A Survey:本论文采用的检索与采信机制。
- C-SEO Bench (Puerto et al. 2025):得出相反结果的重要复现研究,建议与 §6 对照阅读。
- 生成式引擎优化:从业者如何扩展这一术语,以及这种用法与狭义学术来源之间的关系。
常见问题
「GEO 论文」指的是哪篇,为什么重要?
它提出的两种可见度指标是什么?
「最高 40%」这个数字今天还成立吗?
论文对 GEO 与 SEO 的关系怎么说?
代码和基准是否可获取?
相关工作
参考来源
一手来源
- GEO: Generative Engine Optimization (Aggarwal et al., KDD 2024) · arXiv / KDD '24 · 2024-08-25
- GEO: Generative Engine Optimization (KDD '24 Proceedings) · ACM SIGKDD · 2024-08-25
- GEO — official code & experiments repository · GEO-optim
- GEO-bench dataset (HuggingFace) · HuggingFace
- GEO project page · GEO-optim
- Retrieval-Augmented Generation for LLMs: A Survey (Gao et al. 2023) · arXiv · 2023-12-18
二手来源
- C-SEO Bench: Does Conversational SEO Work? (Puerto et al. 2025) · arXiv / NeurIPS '25 D&B
- Evaluating Verifiability in Generative Search Engines (Liu et al. 2023) · arXiv / EMNLP '23 Findings