跳到正文

GEO:生成式引擎优化(Aggarwal 等,2024)

速览要点

原文标题
GEO: Generative Engine Optimization
作者
Pranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit, Ashwin Kalyan, Karthik Narasimhan, Ameet Deshpande
发表信息
KDD 2024 (Proc. 30th ACM SIGKDD)
年份
2024
DOI
10.1145/3637528.3671900
链接
https://arxiv.org/abs/2311.09735
可复现性
代码与数据均公开
证据基础
GEO-bench:1 万条查询,25 个领域,9 个来源数据集
测试对象
内部 GPT-3.5 实验系统(使用 Google 前五条结果),以及线上引擎 Perplexity.ai
核心结论
可见度最高提升 40%,这是按方法与领域计算的上界;线上引擎中最高约为 22%

通俗摘要

Aggarwal 等人提出了一个当时全新的问题:如果 AI 搜索引擎直接写出答案,而不是罗列链接,应当怎样提高内容出现在答案中的机会?他们把这一问题定义为「生成式引擎优化」,构建了 GEO-bench(涵盖 25 个领域的 1 万条查询)作为评测基准,并测试了九种内容改写方法。结果显示:补充引用、统计数据和引述,能稳定提高页面在合成答案中的可见度,在论文的实验设置下最高可达 40%;关键词堆砌这种 SEO 常见做法则没有效果。

关键发现

  • 按论文的 Position-Adjusted Word Count 指标计算,改写内容(补充引用、统计数据和引述)最高可使可见度提升约 40%。
  • 「最高 40%」是特定方法、特定领域下的上界,并非平均效果;从业文章常忽略其适用范围,直接沿用这一醒目数字。
  • 方法效果取决于领域与引擎:Cite Sources 在事实型查询中表现最好,Authoritative 在辩论与历史类查询中表现最好,Statistics Addition 在法律与观点类查询中表现最好。
  • 关键词堆砌这种传统 SEO 做法没有帮助,甚至可能有害。这是早期证据,表明 GEO 并不只是给传统 SEO 手法换个名称。
  • 排名靠后的页面收益最大(Cite Sources 使排在第 5 位的页面可见度提升 +115.1%),说明 GEO 在一定程度上削弱了搜索中原有位次带来的优势。
  • 这些效果在对线上引擎 Perplexity.ai 的测试中仍然存在,最高增幅约为 22%,明显小于内部引擎,说明结论推广到其他环境时存在局限。

1. 这篇论文是什么,为什么它奠定了整个领域

生成式引擎优化这一领域的名称出自这篇论文。GEO: Generative Engine Optimization(Aggarwal et al., KDD 2024)是 GEO 一词的学术来源。

论文把一个含糊的从业者直觉(「让我的内容出现在 AI 答案中」)转化为可以度量的优化问题,同时提供了一套公开基准。

论文采用的是狭义定义,结论仅适用于它自己的基准:研究对象是在固定评测系统中改写内容。此后,从业者又用「GEO」指代整个学科,因此今天围绕这个词的多数说法,并未经过这篇论文验证。

2. 论文如何定义研究问题

论文从搜索结果形态的根本变化出发:结果页过去是一列排序链接,生成式引擎返回的却是单一合成答案。可见度(visibility)不再等同于排名。

论文有意把模型尽量简化:

  • 生成式引擎是一个黑箱:内容创作者无法改动模型,只能改动作为输入的网页内容。
  • 目标是尽可能提高内容在合成答案中的可见度,而不是提高它在链接列表中的排名。
  • 优化能否奏效,取决于生成答案时如何使用页面文本。正因如此,论文没有沿用排名,而是另设了可见度指标(见 §4)。

论文的前提是存在检索(retrieval)与采信(grounding)机制,用来决定引擎选取哪些来源,以及怎样利用这些来源生成答案。相关机制见 answer loopGao et al. 2023 也对此做过综述。论文假定这套机制成立,并据此提出优化问题。

3. 方法学:GEO 框架与 GEO-bench

论文评估了九种内容优化方法,每一种方法都会以特定方式改写候选来源网页:

#方法一句话意图
1Authoritative以更具权威性的语气改写
2Statistics Addition补充相关的量化数据
3Keyword Stuffing增加查询关键词(SEO 常见做法)
4Cite Sources增加对可信来源的引用
5Quotation Addition增加相关引述
6Easy-to-Understand简化语言
7Fluency Optimization提升流畅度
8Unique Words加入不常见或独特的词汇
9Technical Terms加入相关领域的技术术语

基准 GEO-bench 的构建方式:

  • 1 万条查询,划分为 8K 训练、1K 验证、1K 测试。
  • 取自 9 个数据集:MS MARCO、ORCAS-I、Natural Questions、AllSouls、LIMA、Davinci-Debate、Perplexity.ai Discover、ELI5,以及 GPT-4 生成的查询。
  • 查询覆盖 25 个领域(如 Arts、Health、Games),并按七种方式归类。
  • 每条查询附带其 Google 前 5 条结果,作为候选来源集。

实验测试了两个引擎:一个是内部搭建的生成式引擎(使用 GPT-3.5-turbo,以 Google 前 5 条结果为输入),另一个是已经上线的 Perplexity.ai,用于在线上环境中对照验证。

4. 可见度指标:后续研究最常沿用的一项贡献

后续工作反复沿用的,不是论文中的某种具体方法,而是它提出的指标。论文没有停留在判断 引用与提及 的有无,而是把可见度细化为连续且随位置变化的指标。

论文提出两种可见度指标:

Position-Adjusted Word Count (Imp_pwc):
  对被引用句子 s 求和:|s| · e^(-pos(s)/|S|)
  再除以回答总词数

= 被引用句子的词数,按句子在答案中
  出现的早晚做指数衰减。
Subjective Impression:
  由 GPT-3.5 在 7 个子维度上评分的综合指标:
  相关性 · 影响力 · 独特性 · 主观位置 ·
  主观计数 · 点击可能性 · 多样性

与「有没有被引用」这种是非判断相比,它衡量的是一个来源对答案的影响程度,而这正是 可引用性(citability) 要优化的对象。后来,多数厂商在设定 KPI 和 GEO 指标体系时,也沿用了按位置加权的思路。

5. 结果细节

下表列出论文的核心结果,同时标明它们的适用边界:

发现细节
最高增幅GEO 方法在 Position-Adjusted Word Count 上最高可使可见度提升约 40%
表现最佳的方法Quotation Addition +41%(PAWC);Statistics Addition +37%(Subjective);Cite Sources +30%(PAWC)
不是平均值「最高 40%」是按方法、按领域计算的上界,不能当作在所有情况下都能达到的预期增益
取决于领域Cite Sources 在事实型查询中表现最好;Authoritative 在辩论与历史类查询中表现最好;Statistics 在法律与观点类查询中表现最好
传统 SEO 做法失效Keyword Stuffing 没有帮助,而且可能有害
低位页面收益更大排名第 5 的页面收益最大,Cite Sources 使其可见度提升 +115.1%
线上引擎验证在 Perplexity.ai 上最高提升约 22%,增幅小于内部引擎

把「传统 SEO 做法失效」和「线上引擎验证」两项放在一起,结论很明确:应当改进内容本身,不应依赖关键词技巧;同时要注意,这个百分比只是上限,并非通常可以达到的增幅。

6. GEO Wiki 评估

这篇论文有三项奠基性贡献,至今依然成立:

  1. 命名与界定。把「进入 AI 答案」转化为一个黑箱优化问题,为整个领域奠定了基础。
  2. 可见度指标。论文用连续且按位置加权的指标来衡量来源对答案的影响,这一思路后来被广泛沿用。
  3. 公开基准。GEO-bench 让研究结论可以检验,也为后续研究质疑这些结论提供了基础。

不过,这些结论也有四点局限:

  1. 外部效度有限。实验测试的是 2023–24 年的引擎形态,即一个内部 GPT-3.5 实验系统和 Perplexity.ai。今天的 ChatGPT Search、Gemini 与 Google AI Overviews 已采用不同的检索与合成方式,因此不能据此认定结论也适用于这些系统。
  2. 基准会随时间失效。GEO-bench 的语料与引擎都会老化。「40%」只反映 2024 年当时的实验结果,不能跨年份视为常数。
  3. 后续复现得出相反结果。Puerto 等人的 C-SEO Bench(NeurIPS 2025 Datasets & Benchmarks)发现,一旦多方针对同一引擎同时优化,许多对话式 SEO 改写就会失效,甚至适得其反。本论文测得的提升只反映单一参与者优化时的情形,是上界,并不代表多方博弈后的均衡。
  4. 醒目数字容易被误读。「最高 40%」在从业文章中常被简化为「约 40%」。准确的说法是:这是一个按方法、按领域计算的最大值,在线上引擎中已缩小到约 22%,还可能因竞争和可信度筛选(E-E-A-T)而进一步缩小。

GEO Wiki 的判断是:奠基不等于可以直接照搬。可以沿用的是论文指出的方向,即补充来源、统计数据和引述比操纵关键词更有效;具体增幅则不宜沿用,更不能把它当作规划依据。

7. 可复现性

以下状态在撰稿时(2026-05-17)逐项核实过,并非凭推测:

产出物状态
源代码公开:github.com/GEO-optim/GEOrun_geo.pygeo_functions.py
基准数据公开:HuggingFace GEO-optim/geo-bench
许可Apache-2.0
项目页generative-engines.com/GEO/

字段取值:code-and-data。方法实现与 GEO-bench 均已公开,因此论文中的主要实验可以独立复现。相对于这一领域的多数论文,这是一个明显的优势。

8. 它对从业者意味着什么

可以沿用的做法和需要避免的误区如下:

  • 可以用:改进内容本身。补充可信的 引用、具体的统计数据和相关引述,这些做法经过反复验证,结论也相对稳定。
  • 可以用:使用连续指标衡量可见度。持续追踪一个来源在答案中的显著程度,不要只记录是否被引用,并把这项指标纳入 AI 引用追踪
  • 不要用:具体百分比,以及任何跨引擎、跨领域的外推。同一处改写在 ChatGPT SearchPerplexity.ai 上的表现并不一致。
  • 不要默认收益能够持续:单一参与者获得的收益,在竞争者也开始优化之后未必还能保持(见 §6,C-SEO Bench)。

9. 延伸阅读

常见问题

「GEO 论文」指的是哪篇,为什么重要?
指 Aggarwal 等人的 GEO: Generative Engine Optimization(KDD 2024)。GEO 一词在学术上出自这篇论文;它首次把「为 AI 合成答案优化内容」定义为正式研究问题,并提供公开基准(GEO-bench)和可见度指标。
它提出的两种可见度指标是什么?
共有两个指标:Position-Adjusted Word Count 统计被引用句子的词数,并根据句子在答案中出现的位置衰减权重;Subjective Impression 则由 GPT-3.5 从相关性、影响力、独特性等七个子维度分别评分,再汇总为综合指标。
「最高 40%」这个数字今天还成立吗?
应当把它看作适用范围有限的上界估计,不能视为保证。它是针对 2023–24 年的引擎形态,按方法与领域计算的最大值;在线上引擎(Perplexity.ai)中最高提升约 22%,后续研究(C-SEO Bench)还发现,许多此类改写在多方竞争时会失效。
论文对 GEO 与 SEO 的关系怎么说?
关键词堆砌这种经典 SEO 做法没有提高可见度,甚至可能使其下降;而改进实质内容(补充引用、统计数据)则有效。这是早期证据,表明 GEO 并不只是给传统 SEO 手法换个名称。
代码和基准是否可获取?
可以。代码位于 github.com/GEO-optim/GEO,GEO-bench 托管在 HuggingFace(GEO-optim/geo-bench),采用 Apache-2.0 许可,因此论文中的主要实验可以独立复现。

相关工作

参考来源

一手来源

  1. GEO: Generative Engine Optimization (Aggarwal et al., KDD 2024) · arXiv / KDD '24 · 2024-08-25
  2. GEO: Generative Engine Optimization (KDD '24 Proceedings) · ACM SIGKDD · 2024-08-25
  3. GEO — official code & experiments repository · GEO-optim
  4. GEO-bench dataset (HuggingFace) · HuggingFace
  5. GEO project page · GEO-optim
  6. Retrieval-Augmented Generation for LLMs: A Survey (Gao et al. 2023) · arXiv · 2023-12-18

二手来源

  1. C-SEO Bench: Does Conversational SEO Work? (Puerto et al. 2025) · arXiv / NeurIPS '25 D&B
  2. Evaluating Verifiability in Generative Search Engines (Liu et al. 2023) · arXiv / EMNLP '23 Findings
最近更新: 2026-05-17 作者: Ray Yang 主题: 生态