C-SEO Bench:对话式 SEO 是否有效?(Puerto 等,2025)
速览要点
- 原文标题
- C-SEO Bench: Does Conversational SEO Work?
- 作者
- Haritz Puerto, Martin Gubri, Tommaso Green, Seong Joon Oh, Sangdoo Yun
- 发表信息
- NeurIPS 2025 Datasets and Benchmarks Track (Advances in Neural Information Processing Systems 38)
- 年份
- 2025
- DOI
- 10.52202/085713-0923
- 链接
- https://arxiv.org/abs/2506.11097
- 可复现性
- 代码与数据均公开
- 证据基础
- 两项任务、六个领域,共 1,921 条查询和 16,360 条文档记录
- 测试对象
- GPT-4o mini、Claude 3.5 Haiku、o3 与 o4-mini 的指定模型版本
- 核心结论
- 54 种情形中仅有 3 种显著提升排名;上下文顺序的影响比内容改写更稳定
通俗摘要
Puerto 等人测试了十种白帽内容改写,以检验已经进入候选集的文档经过改写后,能否在对话式搜索引擎的引用结果中排得更靠前。实验涵盖两项任务、六个领域和四个回答模型版本,并考察多份竞争文档同时采用同一方法时的结果。研究发现,大多数改写要么表现不稳定,要么使排名变差;相比之下,文档在模型上下文中的先后顺序所产生的影响更稳定。这些结果说明,不能把某种改写视为普遍有效的方法,但也不能据此认定 GEO、优质内容或检索优化无效。
关键发现
- 论文共报告 54 项主要显著性检验;经过多重比较校正,只有 3 项显示引用排名显著提高。
- 在由模型和领域构成的 24 个组合中,有 19 个显示“统计数据”改写会使引用排名显著下降。这说明,看似合理的质量信号也可能产生反效果。
- 所有改写在问题回答领域均未取得显著效果;使用 Claude 3.5 Haiku 时,也没有任何方法显示出显著效果。
- 与内容改写相比,手动把文档放在模型上下文中更靠前的位置,带来的排名提升更大,也更稳定。
- 少数方法只有在单份文档采用时才会带来增益;随着采用同一方法的竞争文档增多,增益逐渐减小,并在所有文档都采用时接近于零。
- 这套基准只测试英文内容、能够完整放入上下文的文档、四个专有模型版本和十种白帽改写,不能据此判断整个 GEO 领域是否有效。
1. 论文要检验什么假设
对话式搜索引擎优化(Conversational Search Engine Optimization,C-SEO)常被归纳为一系列内容改写方法,例如加入统计数据、采用更权威的语气、补充引用、简化文字,或者把摘要放在模型输入中更靠前的位置。这些方法都基于同一个假设:只要按这种方式改写文档,对话式系统就会在选择和排列引用时把它排得更靠前。
C-SEO Bench 用比早期研究更周全的实验方案检验了这个假设。Puerto、Gubri、Green、Oh 和 Yun 测试了十种白帽改写方法,实验涵盖产品推荐和问题回答两项任务、六个领域以及四个专有模型版本。研究人员还设置了不同的采用率(adoption rate):先让一份文档使用某种方法,再逐步增加采用同一方法的竞争文档,直至所有文档都采用。
实验结果与常见预期明显相反。大多数改写无法稳定提高引用排名(citation rank),有些方法还会使排名下降。相比之下,文档在模型上下文(context)中的先后位置对排名的影响更为稳定。这并不意味着生成式引擎优化已经失效,而是说明:一种内容改写即使在某个模型、某个领域或只有一份文档采用时有效,也不能直接视为普遍适用的排名方法。
| 范围 | 这套基准说明了什么 |
|---|---|
| 已测试 | 在固定的候选集中测试十种白帽文档改写;实验覆盖两项任务、六个英文领域和四个回答模型版本 |
| 已发现 | 只有很少几种情形显著提高引用排名;部分方法经常使排名下降;文档在上下文中的位置越靠前,排名提升越明显 |
| 未测试 | 线上搜索产品中从检索到安全策略的完整系统,以及非英文内容、无法完整放入上下文的长文档、收入、流量和其他 GEO 方法 |
这些范围限制决定了应该如何理解研究结论。C-SEO Bench 提高了判断内容改写是否有效时所需的证据标准。尽管这项基准提供了较为充分的研究证据,而且大多数结果都未能证明改写有效,它仍不足以否定优质内容、检索优化或其他面向 AI 答案系统的优化实践。
2. 如何把问题转化为实验:检索排名、引用排名与竞争
从业者常把检索和生成混在一起讨论,这篇论文则将两者分开。检索(retrieval)决定哪些文档可以进入模型上下文,以及这些文档在输入中的先后顺序;到了生成阶段,模型再决定引用哪些候选文档以及如何排列引用。传统搜索优化可能影响检索阶段,C-SEO 改写则试图影响生成阶段。
查询
→ 检索与候选排序
→ 模型上下文中按顺序排列的文档
→ 生成答案并选择来源
→ 引用排名
C-SEO Bench 评估改写时保持候选集不变,只将其中的原始文档换成改写版本,然后观察该文档的引用位置是否改变。论文对排名增益(rank gain)的定义如下:
排名增益 = 基线引用排名 − 优化后的引用排名
例:从第 5 位升到第 2 位,增益为 +3;从第 2 位降到第 5 位,增益为 −3
正值表示文档排名上升,负值表示排名下降。这个指标只反映文档在竞争中的名次变化,不能说明答案从某个来源取用了多少文字、生成内容是否正确,也不能说明每条引用能否充分支持对应的句子。讨论排名与可引用性的关系时,不能忽略这些区别:段落要便于模型使用,才有机会参与引用竞争;但便于使用既不保证引用位置更高,也不保证证据充分。
论文还将竞争情形纳入实验。单方实验会随机选择一份文档进行改写,其余竞争文档保持不变。随机选择目标文档,可以减少其原始检索位置对结果造成的干扰。多方实验则逐步增加采用同一方法的候选文档比例,从 10% 提高到 100%。
| 设置 | 回答的问题 | 应当如何理解 |
|---|---|---|
| 单个采用者 | 一份改写后的文档能否超过未改写的竞争文档? | 衡量只有一方采用或率先采用时的效果 |
| 采用率 10%–90% | 竞争者也采用同一方法后,原有优势能否保持? | 衡量竞争优势可以维持多久 |
| 采用率 100% | 所有文档都使用同一方法后,该方法还能否让文档彼此区分? | 判断该方法能否持续形成差异,还是会因普遍采用而失去相对优势 |
| 采用率 AUC | 采用率从 0% 升至 100% 时,平均排名增益是多少? | 概括一种方法在不同采用率下是否稳定,而不是只看效果最好的采用率 |
这项设计不只比较单份文档改写前后的差异,还评估竞争者跟进后的结果。一种改写可能让率先采用的文档暂时超过未改写的对手;等所有文档都采用后,这种优势可能就会消失。单方实验只能说明一种方法能否带来短期优势;所有文档都采用时的结果,则有助于判断这种方法是否真正改善了信息质量,而不只是形成暂时的相对优势。
3. 方法:两项任务、六个领域、1,921 条查询、16,360 条文档记录
官方数据集包含 1,921 条互不重复的查询(query),以及 16,360 条查询与文档的配对记录。产品推荐和问题回答任务各涵盖三个领域,但两项任务构造查询的方式、文档来源和候选文档数量并不相同。
| 任务 | 领域 | 查询数 | 文档记录数 | 来源与构造方式 |
|---|---|---|---|---|
| 产品推荐 | 零售 | 500 | 5,000 | 商品和查询取自 Amazon Shopping Queries |
| 产品推荐 | 电子游戏 | 436 | 4,360 | 使用 Steam 游戏目录记录和推荐查询 |
| 产品推荐 | 图书 | 249 | 2,245 | 使用 Google Books 记录和模型生成的查询 |
| 问题回答 | 网页 | 300 | 1,500 | 使用网页段落和模型生成的扩展查询 |
| 问题回答 | 新闻 | 294 | 2,375 | 使用 Multi-News 文档和模型生成的问题 |
| 问题回答 | 争议议题 | 142 | 880 | 采用 Liu 等人的查询和表达支持或反对立场的片段,并剔除可用片段不足五个的查询 |
| 合计 | 六个领域 | 1,921 | 16,360 | 所有内容均为英文 |
在产品推荐任务中,回答模型会收到十份没有预先排序的候选文档,并从中选出五项进行推荐,说明理由。问题回答任务则要求模型依据候选文档作答并附上引用。这两项任务需要分别分析:一种方法即使能够影响更侧重说服力的商品选择,也未必能在事实问答或涉及争议性来源的回答中取得同样效果。
需要说明的是,这里的“真实数据”有其限定条件。数据集中的来源记录包括真实商品、图书、网页段落、新闻和争议议题片段,但有些查询或扩展查询由模型生成。争议议题子集采用了 Liu 等人的可验证性研究中的查询和配套片段,并剔除候选片段数量不足的查询。因此,这套数据并非完全由模型合成,但也不能把其中每条查询都视为真实用户行为的原始记录。
优化后的文档版本统一由 gpt-4o-mini-2024-07-18 生成。回答实验使用四个指定的 API 模型版本:
| 角色 | 模型版本 |
|---|---|
| 生成改写 | gpt-4o-mini-2024-07-18 |
| 对话型回答模型 | gpt-4o-mini-2024-07-18 |
| 对话型回答模型 | claude-3-5-haiku-20241022 |
| 推理型回答模型 | o3-2025-04-16 |
| 推理型回答模型 | o4-mini-2025-04-16 |
指定模型版本有助于核查实验,但也意味着结论只适用于特定时期。这些模型版本不能代表面向用户的完整搜索产品,因为实验没有复现线上爬虫、检索索引、排序系统、引用后处理或安全策略。
4. 评测协议:十种改写、排名增益、显著性与采用率 AUC
十种方法中,有八种来自 Aggarwal 等人评估过的内容改写。C-SEO Bench 另外加入“内容改进”,综合运用此前的改写思路;还加入“模型引导”,将生成的 Markdown 摘要放在文档之前,再把摘要和正文一并送入模型上下文。
| 方法 | 如何改写 | 预期作用 |
|---|---|---|
| 权威语气(Authoritative) | 将原文改为更具权威感的表达 | 使内容显得更可信、更专业 |
| 统计数据(Statistics) | 加入量化信息或统计性表述 | 使内容更具体,并提供更多证据 |
| 引用(Citations) | 加入引用或附有出处的支持材料 | 为内容提供外部依据 |
| 流畅度(Fluency) | 提高行文的流畅度和可读性 | 让内容更容易理解 |
| 多样用词(Unique Words) | 减少重复用词,增加词汇变化 | 使文档的用词更具独特性 |
| 专业术语(Technical Terms) | 加入相关领域的术语 | 提高内容的专业性 |
| 简明语言(Simple Language) | 简化措辞 | 让内容更容易阅读 |
| 引述(Quotes) | 加入相关引述 | 提供可以明确追溯到说话者的证据 |
| 内容改进(Content Improvement) | 综合使用前八项内容改写指令 | 从多个方面改进内容 |
| 模型引导(LLM Guidance) | 将生成的 Markdown 摘要放在文档之前,再一并输入模型上下文 | 帮助模型选择和整合信息 |
模型引导受 llms.txt 启发,但实验没有直接测试公开部署的 llms.txt 文件。实验人员直接把摘要插入回答模型的输入,整个过程不需要爬虫发现、抓取、解析或遵循网站上的文件。因此,即使这种方法取得正面结果,也不能证明公开部署 llms.txt 会影响任何线上系统。
评测方案既衡量平均变化,也考察效果是否稳定:
| 环节 | 做法 | 防止什么误判 |
|---|---|---|
| 目标选择 | 在单方测试中随机选择要改写的文档 | 避免把目标文档原始检索位置造成的差异误认为改写效果 |
| 排名指标 | 比较改写前后的引用位置 | 避免把任何文本变化都视为可见度有所提高 |
| 显著性检验 | 使用单尾 Wilcoxon 符号秩检验 | 避免假定排名变化服从正态分布,也避免只根据平均值判断 |
| 多重检验 | 使用 Holm–Bonferroni 方法校正 | 避免在大量比较中把偶然出现的结果误认为方法有效 |
| 多方采用 | 逐步增加改写后的候选文档,直至十份文档都采用同一种改写 | 避免忽略竞争者采用相同方法后的变化 |
| 采用率 AUC | 对采用率从 0% 到 100% 时的排名增益曲线进行积分 | 避免只挑效果最有利的采用率汇报 |
这些设计减少了因平均值的随机波动而产生误判的风险,也进一步明确了结论的适用范围。即使某项结果在这套基准中达到统计显著水平,也不代表它必然适用于线上搜索引擎或其他类型的文档。
5. 结果:很少有改写奏效,上下文位置影响更大
实验并没有发现所有改写都必然失败,但能稳定产生正面效果的方法很少。具体效果会因方法、任务、领域、模型和采用率而变化。
| 发现 | 最有力的证据 | 适用边界 |
|---|---|---|
| 可靠的正面结果很少 | 在 54 项主要显著性检验中,校正后只有 3 项显示排名显著提高 | 大多数被测改写都没有得到广泛证据支持,但实验没有覆盖尚未测试的方法 |
| 效果因任务而异 | 所有改写在问题回答领域都没有显示出显著效果 | 不能把推荐任务中的结果直接推广到事实性问答 |
| 效果因模型而异 | 使用 Claude 3.5 Haiku 时,没有任何方法显示出显著效果 | 不能据此认定某种方法在不同模型上都同样有效 |
| 负面影响不可忽略 | 在由模型和领域构成的 24 个组合中,有 19 个显示“统计数据”改写会使引用排名显著下降 | 添加数字可能产生反效果,但这不代表准确的量化证据本身有害 |
| 输入顺序影响更大 | 把目标文档放在第一位后,六个领域的排名都显著上升,平均排名增益为 0.70–2.77 | 实验证明上下文位置会影响结果,但没有证明任何一种线上 SEO 方法有效 |
| 优势会随普及而消退 | 在单方采用时表现最好的方法,会随着采用率上升而逐渐失去效果;所有文档都采用时,增益接近于零 | 引用排名具有竞争性,但实验没有直接测量总流量或市场需求 |
显著提高排名的三种情形分别是:模型引导在零售和电子游戏领域有效,内容改进在零售领域有效。问题回答任务中没有任何方法显著有效。与汇总平均值相比,这种结果分布更能说明问题:正面效果似乎集中在推荐场景,简洁、直接的说明可能会影响模型的选择。
排名下降并非偶发现象。在由模型和领域构成的 24 个组合中,有 19 个显示“统计数据”改写会使排名显著下降。在 Haiku 的产品推荐实验中,由方法和领域构成的 30 个组合中,有 26 个显示排名显著下降;在 o4-mini 的问题回答实验中,30 个组合中有 19 个显示排名显著下降。某种内容属性即使本身具有价值,也不应被简化为必然奏效的排名技巧。准确的统计数据可以帮助读者理解和核实内容,但在特定提示词和候选集下,它仍可能无法提高引用排名,甚至使排名下降。
平均值还可能掩盖不同文档之间的差异。以零售领域的模型引导为例,61.0% 的文档排名不变,26.2% 上升,12.8% 下降。因此,平均值略高于零,并不表示每份改写后的文档都能获益。实际结果有升有降,但占比最大的是排名不变。开展实际测试时,应同时报告这三类结果,不能只列平均值或表现最好的案例。
实验中,最稳定地影响引用排名的做法并不是改写内容,而是手动把目标文档放在上下文中更靠前的位置。目标文档处于第一位或第二位时,六个领域的排名变化都达到显著水平,而且幅度大于内容改写。对实践而言,这意味着应先设法让相关内容进入候选集并获得靠前位置,再考虑用通用指令润色已经入选的文档。不过,实验没有说明如何在 Google、Bing 或其他线上系统中获得这样的位置,因为研究人员直接调整了上下文中的文档顺序,没有改变上游排序算法。
多方采用实验还表明,少数有效方法的竞争价值会随着普及程度而改变。在零售或电子游戏领域,模型引导和内容改进可以帮助率先采用的文档;但采用同一方法的文档越多,排名优势就越小。全部候选文档都采用后,优势接近于零。候选列表固定时,引用排名具有一定的零和性质,不可能让所有文档都排在第一位。Nestaas 等人的对抗性研究也发现,操纵模型偏好的方法一旦普及,参与者之间的竞争结果会恶化。不过,两项研究不能混为一谈:Nestaas 等人研究的是黑帽攻击,C-SEO Bench 测试的是白帽改写。
6. GEO Wiki 评估:更有力的基准,并非对 GEO 的全面否定
这篇论文最大的贡献是提出更严谨的评测方法,而不是再提供一种新的改写方案。
- 研究采用同一套方案评估两项任务和六个领域,发现有些方法在一个领域有效,在其他领域则会失效。这种差异在只测试单一数据集时不容易显现。
- 研究以引用排名和采用率 AUC 为主要指标,衡量竞争条件下模型如何选择来源,而不只是计算答案从某个来源取用了多少文字。
- 研究公开了基准、改写后的文档、代码和结果,研究者因而能够复查大规模实验中的负面结果,而不必只依赖个别案例。
这项研究与最初的 GEO 基准确实得出了明显不同的结果,但简单地称之为复现失败并不准确,因为两篇论文在多个方面采用了不同的实验设置:
| 维度 | Aggarwal et al. 2024 | C-SEO Bench 2025 | 较为稳妥的比较结论 |
|---|---|---|---|
| 主要结果指标 | 标准化词数、根据位置调整权重后的词数,以及主观印象 | 引用排名增益与采用率 AUC | 改写可能增加答案取用某个来源文字的比例,却无法稳定提高引用排名 |
| 竞争设置 | 主要让一份优化后的来源与其他未改写来源竞争 | 随机选择一份目标文档,并测试采用率从 10% 增至 100% 时的结果 | 率先采用时带来的提升,不等于可以长期维持的竞争优势 |
| 任务 | GEO-bench 中的问题回答 | 产品推荐与问题回答 | 不能把推荐任务中的效果推广到问题回答任务 |
| 领域 | 约 10,000 条查询,来自九个基准数据源 | 六个划分明确的领域,共 1,921 条查询和 16,360 条记录 | 新研究测试了不同的领域组合,并且领域划分更明确 |
| 模型 | 原研究开展时可用的生成式引擎与模型 | 四个指定的 2024–2025 年专有 API 模型版本 | 两篇论文都不能给出在所有模型上始终成立的固定效果值 |
| 能够支持的结论 | 部分改写提高了该研究采用的可见度指标 | 多数被测改写都未能在不同情形下重复提高引用排名 | 新研究提高了声称一种方法普遍有效时应满足的证据标准 |
若要准确理解这套基准,而不是把它误读为对 GEO 的全面否定,还需要注意五项限制。
第一,两项研究采用的评估指标不同。引用排名固然有用,但它不能反映某个来源的文字在答案中占多少篇幅、引用能否支持事实、品牌是否被提及或用户是否转化。C-SEO Bench 也指出,其引用排名结果不一定与早期研究的词数结果冲突。综合两项研究时,应当比较同类指标,不能只挑选符合既定立场的数字。
第二,检索顺序基线只提供了间接证据。手动把文档放在第一位,可以证明回答模型会受到输入位置的影响,却不能证明改写标题、建设链接、添加结构化数据或采用其他搜索优化方法,能够在真实索引中取得同等幅度的效果。
第三,实验设置决定了结论很难直接推广到基准之外。四个专有模型版本只能依据固定的候选集作答。ChatGPT Search、Perplexity 和 Google AI Overviews 等完整产品还会进行查询改写、抓取、排序、去重、安全处理和引用呈现,也会受到产品自身策略的影响,这些环节都不在实验范围内。模型提供方还可能在指定版本发布后调整模型行为。
第四,实验覆盖的语言和上下文条件较为有限。基准只测试英文内容,而且所有文档都能完整放入模型可用的上下文。长文被截断、跨语言检索、生成过程中的摘要处理,以及不同文化背景下对可信度的判断方式,都可能改变实验结果。
第五,实验测试的方法有限。十种白帽改写不能代表所有内容优化、技术优化或分发方法。论文也没有评估传统检索优化和 C-SEO 改写结合使用时会产生什么效果。负面结果既不能证明未来出现的方法必然无效,也不能用于判断实验未涉及的操纵手段。
另外两项研究有助于解释这些结果的可能成因,但不能作为 C-SEO Bench 的直接证据。Wan 等人发现,模型在相互冲突的来源之间作选择时,主题相关性比科学引用、中立语气等形式上的可信度信号更重要。这与通用风格改写作用较弱的现象一致,但 Wan 研究的是另一类偏好判断任务,使用的模型也更早。Nestaas 等人发现,对抗性偏好操纵会使多方参与者陷入囚徒困境,与竞争优势逐渐消失的现象相似。不过,他们研究的是黑帽提示注入攻击,不同于这里的白帽改写。
因此,稳妥的结论不是全盘否定 GEO,而是要求研究提供更严格的证据:应当分别报告方法在不同任务、领域、模型、基线位置和采用率下的效果。C-SEO Bench 所否定的,是把单方实验测得的最佳效果当成普遍规律;它也由此提高了 GEO 相关主张需要满足的实证标准。
7. 可复现性:研究者能重跑哪些部分
官方公开的材料足以支持 code-and-data 评级,包括基准记录、生成的文档版本、实验笔记本(notebook)、评估代码和结果存档。这些材料尤其便于复查负面结果。不过,整套实验依赖的外部环境会随时间变化,研究者也无法通过一条命令完整复现所有结果。
| 资产 | 可获取性 | 许可 | 重跑限制 |
|---|---|---|---|
| 最终论文 | NeurIPS 论文集 | 出版方访问条件 | 方法与结果应以最终版本为准 |
| 代码与实验笔记本 | 官方 GitHub 仓库 | MIT | 研究者需要自行配置运行环境;仓库中未发现带标签的正式版本 |
| 基准数据 | 官方 Hugging Face 数据集 | 数据卡首页标注 Apache-2.0 | 上游数据集各自适用不同许可,其中 Multi-News 的使用受到限制 |
| 改写文档与结果 | 官方结果数据集 | 数据卡首页标注 Apache-2.0 | 数据量较大,使用时必须选取与目标实验设置对应的数据 |
| 模型访问 | OpenAI 与 Anthropic API | 提供方条款 | 精确重跑需要付费 API 密钥,而且指定的历史版本必须仍然可用 |
| 依赖 | 仓库中的 requirements 与项目配置 | 各软件包许可不同 | 核心依赖的版本已经锁定,部分实验笔记本使用的工具尚未锁定;README 与项目配置对 Python 版本的要求也不一致 |
代码许可和数据卡标注的许可需要分别核对。代码采用 MIT 许可;基准数据卡首页标注 Apache-2.0,但论文附录列出的上游语料分别适用不同许可,Multi-News 尤其受到仅限研究或非商业用途等条件约束。复用数据时,应逐项核对各来源的许可,不能认为数据卡上的许可已经取代所有上游条件。
能否精确复现,还取决于商业 API 和历史模型是否继续可用。利用公开材料,研究者可以核查改写方法、复用已经发布的输出、重新计算统计结果,并重跑大部分流程;但公开材料无法保证模型提供方服务端的推理行为始终不变。因此,代码和数据确实可以获取,但不能由此断言研究者今后仍能以相同成本得到完全相同的输出。
8. 给从业者的启示:先解决检索问题,再把改写作为实验
对实践而言,要点是持续测量可见度,不要把提高可见度简化为一套普遍适用的写作规则。
- 确认内容能够进入候选集。检查内容能否被抓取和索引、是否与主题相关,以及是否满足进入候选集的条件。如果文档根本没有被检索到,无论怎样改写都无法参与引用竞争。
- 记录改写前的表现。按任务和领域划分查询,记录内容在不同引擎、模型或产品中的呈现情况;如果可以观察到检索位置,还应分别记录引用排名上升、下降和不变的比例。
- 进行受控改写。尽量保持候选集和评测提示词不变,每次只改变一项明确的内容属性。无论是补充准确证据、调整结构、添加摘要,还是进行其他实质性改进,都应视为需要验证的假设,不能预先认定有效。
- 在竞争条件下重新测试。模型更新后需要重测,竞争者采用相似写法后也需要重测。不能把率先采用时取得的提升直接用于估算长期回报。
这套实验方案并没有否认准确的统计数据、原创研究、清晰结构或可验证引用的价值。C-SEO Bench 测量的是引用排名变化,无法涵盖优质内容所带来的全部价值。统计数据即使不能提高回答模型给出的引用排名,也可能帮助读者核实信息、作出决定;某个来源即使没有排在引用首位,也可能为相关事实提供更充分的依据。
这一区别也有助于准确理解可引用性的作用。表述清楚、无需依赖上下文就能理解的主张,以及可以追溯出处的证据,都能让模型更容易使用一段内容。这些是参与引用竞争的必要条件,却不能保证排名上升。广义的 GEO 实践还要处理内容能否被技术系统访问、是否与检索需求相关、实体是否清楚、证据质量是否可靠,以及内容分发与效果测量。C-SEO Bench 表明,一套通用的改写指令不能代替这些工作。
团队还应完整保留负面结果。假设 60% 的查询结果没有变化、15% 下降、25% 上升,如果只报告那 25% 的上升结果,就会造成方法普遍有效的错误印象。这套基准最值得借鉴的做法,是报告完整的结果分布、对重复检验进行校正,并继续观察竞争者采用同类方法后,原有效果能否保持。
9. 延伸阅读
- GEO: Generative Engine Optimization(Aggarwal et al. 2024):这是对相关改写方法较为乐观的早期研究,也是本文所测内容改写的来源。可结合 §6,比较两篇论文采用的可见度指标。
- Evaluating Verifiability in Generative Search Engines(Liu et al. 2023):本文争议议题查询和片段的上游来源,也说明引用排名与引用能否充分支持内容是两项不同的指标。
- What Evidence Do Language Models Find Convincing?(Wan et al. 2024):这项研究采用了另一种来源偏好实验,发现主题相关性比形式上的可信度信号更能影响模型,可与本文结果对照阅读。
常见问题
C-SEO Bench 是否证明对话式 SEO 无效?
为什么它与 Aggarwal 等人的 GEO 原始论文结论不同?
上下文位置影响很强,是否证明传统 SEO 一定胜过 GEO?
“模型引导”是否证明公开部署 llms.txt 能提高可见度?
C-SEO Bench 的实验可以复现吗?
相关工作
参考来源
一手来源
- C-SEO Bench: Does Conversational SEO Work? (NeurIPS 2025 proceedings) · NeurIPS 2025 Datasets and Benchmarks Track
- C-SEO Bench: Does Conversational SEO Work? (arXiv) · arXiv · 2025-06-06
- C-SEO Bench official code repository · Parameter Lab / GitHub
- C-SEO Bench official benchmark dataset · Parameter Lab / Hugging Face
- C-SEO Bench official experiment results · Parameter Lab / Hugging Face
二手来源
- GEO: Generative Engine Optimization (Aggarwal et al. 2024) · arXiv / KDD 2024
- Evaluating Verifiability in Generative Search Engines (Liu et al. 2023) · Association for Computational Linguistics
- What Evidence Do Language Models Find Convincing? (Wan et al. 2024) · Association for Computational Linguistics
- Adversarial Search Engine Optimization for Large Language Models (Nestaas et al. 2025) · ICLR 2025