跳到正文

C-SEO Bench:对话式 SEO 是否有效?(Puerto 等,2025)

速览要点

原文标题
C-SEO Bench: Does Conversational SEO Work?
作者
Haritz Puerto, Martin Gubri, Tommaso Green, Seong Joon Oh, Sangdoo Yun
发表信息
NeurIPS 2025 Datasets and Benchmarks Track (Advances in Neural Information Processing Systems 38)
年份
2025
DOI
10.52202/085713-0923
链接
https://arxiv.org/abs/2506.11097
可复现性
代码与数据均公开
证据基础
两项任务、六个领域,共 1,921 条查询和 16,360 条文档记录
测试对象
GPT-4o mini、Claude 3.5 Haiku、o3 与 o4-mini 的指定模型版本
核心结论
54 种情形中仅有 3 种显著提升排名;上下文顺序的影响比内容改写更稳定

通俗摘要

Puerto 等人测试了十种白帽内容改写,以检验已经进入候选集的文档经过改写后,能否在对话式搜索引擎的引用结果中排得更靠前。实验涵盖两项任务、六个领域和四个回答模型版本,并考察多份竞争文档同时采用同一方法时的结果。研究发现,大多数改写要么表现不稳定,要么使排名变差;相比之下,文档在模型上下文中的先后顺序所产生的影响更稳定。这些结果说明,不能把某种改写视为普遍有效的方法,但也不能据此认定 GEO、优质内容或检索优化无效。

关键发现

  • 论文共报告 54 项主要显著性检验;经过多重比较校正,只有 3 项显示引用排名显著提高。
  • 在由模型和领域构成的 24 个组合中,有 19 个显示“统计数据”改写会使引用排名显著下降。这说明,看似合理的质量信号也可能产生反效果。
  • 所有改写在问题回答领域均未取得显著效果;使用 Claude 3.5 Haiku 时,也没有任何方法显示出显著效果。
  • 与内容改写相比,手动把文档放在模型上下文中更靠前的位置,带来的排名提升更大,也更稳定。
  • 少数方法只有在单份文档采用时才会带来增益;随着采用同一方法的竞争文档增多,增益逐渐减小,并在所有文档都采用时接近于零。
  • 这套基准只测试英文内容、能够完整放入上下文的文档、四个专有模型版本和十种白帽改写,不能据此判断整个 GEO 领域是否有效。

1. 论文要检验什么假设

对话式搜索引擎优化(Conversational Search Engine Optimization,C-SEO)常被归纳为一系列内容改写方法,例如加入统计数据、采用更权威的语气、补充引用、简化文字,或者把摘要放在模型输入中更靠前的位置。这些方法都基于同一个假设:只要按这种方式改写文档,对话式系统就会在选择和排列引用时把它排得更靠前。

C-SEO Bench 用比早期研究更周全的实验方案检验了这个假设。Puerto、Gubri、Green、Oh 和 Yun 测试了十种白帽改写方法,实验涵盖产品推荐和问题回答两项任务、六个领域以及四个专有模型版本。研究人员还设置了不同的采用率(adoption rate):先让一份文档使用某种方法,再逐步增加采用同一方法的竞争文档,直至所有文档都采用。

实验结果与常见预期明显相反。大多数改写无法稳定提高引用排名(citation rank),有些方法还会使排名下降。相比之下,文档在模型上下文(context)中的先后位置对排名的影响更为稳定。这并不意味着生成式引擎优化已经失效,而是说明:一种内容改写即使在某个模型、某个领域或只有一份文档采用时有效,也不能直接视为普遍适用的排名方法。

范围这套基准说明了什么
已测试在固定的候选集中测试十种白帽文档改写;实验覆盖两项任务、六个英文领域和四个回答模型版本
已发现只有很少几种情形显著提高引用排名;部分方法经常使排名下降;文档在上下文中的位置越靠前,排名提升越明显
未测试线上搜索产品中从检索到安全策略的完整系统,以及非英文内容、无法完整放入上下文的长文档、收入、流量和其他 GEO 方法

这些范围限制决定了应该如何理解研究结论。C-SEO Bench 提高了判断内容改写是否有效时所需的证据标准。尽管这项基准提供了较为充分的研究证据,而且大多数结果都未能证明改写有效,它仍不足以否定优质内容、检索优化或其他面向 AI 答案系统的优化实践。

2. 如何把问题转化为实验:检索排名、引用排名与竞争

从业者常把检索和生成混在一起讨论,这篇论文则将两者分开。检索(retrieval)决定哪些文档可以进入模型上下文,以及这些文档在输入中的先后顺序;到了生成阶段,模型再决定引用哪些候选文档以及如何排列引用。传统搜索优化可能影响检索阶段,C-SEO 改写则试图影响生成阶段。

查询
  → 检索与候选排序
  → 模型上下文中按顺序排列的文档
  → 生成答案并选择来源
  → 引用排名

C-SEO Bench 评估改写时保持候选集不变,只将其中的原始文档换成改写版本,然后观察该文档的引用位置是否改变。论文对排名增益(rank gain)的定义如下:

排名增益 = 基线引用排名 − 优化后的引用排名

例:从第 5 位升到第 2 位,增益为 +3;从第 2 位降到第 5 位,增益为 −3

正值表示文档排名上升,负值表示排名下降。这个指标只反映文档在竞争中的名次变化,不能说明答案从某个来源取用了多少文字、生成内容是否正确,也不能说明每条引用能否充分支持对应的句子。讨论排名与可引用性的关系时,不能忽略这些区别:段落要便于模型使用,才有机会参与引用竞争;但便于使用既不保证引用位置更高,也不保证证据充分。

论文还将竞争情形纳入实验。单方实验会随机选择一份文档进行改写,其余竞争文档保持不变。随机选择目标文档,可以减少其原始检索位置对结果造成的干扰。多方实验则逐步增加采用同一方法的候选文档比例,从 10% 提高到 100%。

设置回答的问题应当如何理解
单个采用者一份改写后的文档能否超过未改写的竞争文档?衡量只有一方采用或率先采用时的效果
采用率 10%–90%竞争者也采用同一方法后,原有优势能否保持?衡量竞争优势可以维持多久
采用率 100%所有文档都使用同一方法后,该方法还能否让文档彼此区分?判断该方法能否持续形成差异,还是会因普遍采用而失去相对优势
采用率 AUC采用率从 0% 升至 100% 时,平均排名增益是多少?概括一种方法在不同采用率下是否稳定,而不是只看效果最好的采用率

这项设计不只比较单份文档改写前后的差异,还评估竞争者跟进后的结果。一种改写可能让率先采用的文档暂时超过未改写的对手;等所有文档都采用后,这种优势可能就会消失。单方实验只能说明一种方法能否带来短期优势;所有文档都采用时的结果,则有助于判断这种方法是否真正改善了信息质量,而不只是形成暂时的相对优势。

3. 方法:两项任务、六个领域、1,921 条查询、16,360 条文档记录

官方数据集包含 1,921 条互不重复的查询(query),以及 16,360 条查询与文档的配对记录。产品推荐和问题回答任务各涵盖三个领域,但两项任务构造查询的方式、文档来源和候选文档数量并不相同。

任务领域查询数文档记录数来源与构造方式
产品推荐零售5005,000商品和查询取自 Amazon Shopping Queries
产品推荐电子游戏4364,360使用 Steam 游戏目录记录和推荐查询
产品推荐图书2492,245使用 Google Books 记录和模型生成的查询
问题回答网页3001,500使用网页段落和模型生成的扩展查询
问题回答新闻2942,375使用 Multi-News 文档和模型生成的问题
问题回答争议议题142880采用 Liu 等人的查询和表达支持或反对立场的片段,并剔除可用片段不足五个的查询
合计六个领域1,92116,360所有内容均为英文

在产品推荐任务中,回答模型会收到十份没有预先排序的候选文档,并从中选出五项进行推荐,说明理由。问题回答任务则要求模型依据候选文档作答并附上引用。这两项任务需要分别分析:一种方法即使能够影响更侧重说服力的商品选择,也未必能在事实问答或涉及争议性来源的回答中取得同样效果。

需要说明的是,这里的“真实数据”有其限定条件。数据集中的来源记录包括真实商品、图书、网页段落、新闻和争议议题片段,但有些查询或扩展查询由模型生成。争议议题子集采用了 Liu 等人的可验证性研究中的查询和配套片段,并剔除候选片段数量不足的查询。因此,这套数据并非完全由模型合成,但也不能把其中每条查询都视为真实用户行为的原始记录。

优化后的文档版本统一由 gpt-4o-mini-2024-07-18 生成。回答实验使用四个指定的 API 模型版本:

角色模型版本
生成改写gpt-4o-mini-2024-07-18
对话型回答模型gpt-4o-mini-2024-07-18
对话型回答模型claude-3-5-haiku-20241022
推理型回答模型o3-2025-04-16
推理型回答模型o4-mini-2025-04-16

指定模型版本有助于核查实验,但也意味着结论只适用于特定时期。这些模型版本不能代表面向用户的完整搜索产品,因为实验没有复现线上爬虫、检索索引、排序系统、引用后处理或安全策略。

4. 评测协议:十种改写、排名增益、显著性与采用率 AUC

十种方法中,有八种来自 Aggarwal 等人评估过的内容改写。C-SEO Bench 另外加入“内容改进”,综合运用此前的改写思路;还加入“模型引导”,将生成的 Markdown 摘要放在文档之前,再把摘要和正文一并送入模型上下文。

方法如何改写预期作用
权威语气(Authoritative)将原文改为更具权威感的表达使内容显得更可信、更专业
统计数据(Statistics)加入量化信息或统计性表述使内容更具体,并提供更多证据
引用(Citations)加入引用或附有出处的支持材料为内容提供外部依据
流畅度(Fluency)提高行文的流畅度和可读性让内容更容易理解
多样用词(Unique Words)减少重复用词,增加词汇变化使文档的用词更具独特性
专业术语(Technical Terms)加入相关领域的术语提高内容的专业性
简明语言(Simple Language)简化措辞让内容更容易阅读
引述(Quotes)加入相关引述提供可以明确追溯到说话者的证据
内容改进(Content Improvement)综合使用前八项内容改写指令从多个方面改进内容
模型引导(LLM Guidance)将生成的 Markdown 摘要放在文档之前,再一并输入模型上下文帮助模型选择和整合信息

模型引导受 llms.txt 启发,但实验没有直接测试公开部署的 llms.txt 文件。实验人员直接把摘要插入回答模型的输入,整个过程不需要爬虫发现、抓取、解析或遵循网站上的文件。因此,即使这种方法取得正面结果,也不能证明公开部署 llms.txt 会影响任何线上系统。

评测方案既衡量平均变化,也考察效果是否稳定:

环节做法防止什么误判
目标选择在单方测试中随机选择要改写的文档避免把目标文档原始检索位置造成的差异误认为改写效果
排名指标比较改写前后的引用位置避免把任何文本变化都视为可见度有所提高
显著性检验使用单尾 Wilcoxon 符号秩检验避免假定排名变化服从正态分布,也避免只根据平均值判断
多重检验使用 Holm–Bonferroni 方法校正避免在大量比较中把偶然出现的结果误认为方法有效
多方采用逐步增加改写后的候选文档,直至十份文档都采用同一种改写避免忽略竞争者采用相同方法后的变化
采用率 AUC对采用率从 0% 到 100% 时的排名增益曲线进行积分避免只挑效果最有利的采用率汇报

这些设计减少了因平均值的随机波动而产生误判的风险,也进一步明确了结论的适用范围。即使某项结果在这套基准中达到统计显著水平,也不代表它必然适用于线上搜索引擎或其他类型的文档。

5. 结果:很少有改写奏效,上下文位置影响更大

实验并没有发现所有改写都必然失败,但能稳定产生正面效果的方法很少。具体效果会因方法、任务、领域、模型和采用率而变化。

发现最有力的证据适用边界
可靠的正面结果很少在 54 项主要显著性检验中,校正后只有 3 项显示排名显著提高大多数被测改写都没有得到广泛证据支持,但实验没有覆盖尚未测试的方法
效果因任务而异所有改写在问题回答领域都没有显示出显著效果不能把推荐任务中的结果直接推广到事实性问答
效果因模型而异使用 Claude 3.5 Haiku 时,没有任何方法显示出显著效果不能据此认定某种方法在不同模型上都同样有效
负面影响不可忽略在由模型和领域构成的 24 个组合中,有 19 个显示“统计数据”改写会使引用排名显著下降添加数字可能产生反效果,但这不代表准确的量化证据本身有害
输入顺序影响更大把目标文档放在第一位后,六个领域的排名都显著上升,平均排名增益为 0.70–2.77实验证明上下文位置会影响结果,但没有证明任何一种线上 SEO 方法有效
优势会随普及而消退在单方采用时表现最好的方法,会随着采用率上升而逐渐失去效果;所有文档都采用时,增益接近于零引用排名具有竞争性,但实验没有直接测量总流量或市场需求

显著提高排名的三种情形分别是:模型引导在零售和电子游戏领域有效,内容改进在零售领域有效。问题回答任务中没有任何方法显著有效。与汇总平均值相比,这种结果分布更能说明问题:正面效果似乎集中在推荐场景,简洁、直接的说明可能会影响模型的选择。

排名下降并非偶发现象。在由模型和领域构成的 24 个组合中,有 19 个显示“统计数据”改写会使排名显著下降。在 Haiku 的产品推荐实验中,由方法和领域构成的 30 个组合中,有 26 个显示排名显著下降;在 o4-mini 的问题回答实验中,30 个组合中有 19 个显示排名显著下降。某种内容属性即使本身具有价值,也不应被简化为必然奏效的排名技巧。准确的统计数据可以帮助读者理解和核实内容,但在特定提示词和候选集下,它仍可能无法提高引用排名,甚至使排名下降。

平均值还可能掩盖不同文档之间的差异。以零售领域的模型引导为例,61.0% 的文档排名不变,26.2% 上升,12.8% 下降。因此,平均值略高于零,并不表示每份改写后的文档都能获益。实际结果有升有降,但占比最大的是排名不变。开展实际测试时,应同时报告这三类结果,不能只列平均值或表现最好的案例。

实验中,最稳定地影响引用排名的做法并不是改写内容,而是手动把目标文档放在上下文中更靠前的位置。目标文档处于第一位或第二位时,六个领域的排名变化都达到显著水平,而且幅度大于内容改写。对实践而言,这意味着应先设法让相关内容进入候选集并获得靠前位置,再考虑用通用指令润色已经入选的文档。不过,实验没有说明如何在 Google、Bing 或其他线上系统中获得这样的位置,因为研究人员直接调整了上下文中的文档顺序,没有改变上游排序算法。

多方采用实验还表明,少数有效方法的竞争价值会随着普及程度而改变。在零售或电子游戏领域,模型引导和内容改进可以帮助率先采用的文档;但采用同一方法的文档越多,排名优势就越小。全部候选文档都采用后,优势接近于零。候选列表固定时,引用排名具有一定的零和性质,不可能让所有文档都排在第一位。Nestaas 等人的对抗性研究也发现,操纵模型偏好的方法一旦普及,参与者之间的竞争结果会恶化。不过,两项研究不能混为一谈:Nestaas 等人研究的是黑帽攻击,C-SEO Bench 测试的是白帽改写。

6. GEO Wiki 评估:更有力的基准,并非对 GEO 的全面否定

这篇论文最大的贡献是提出更严谨的评测方法,而不是再提供一种新的改写方案。

  1. 研究采用同一套方案评估两项任务和六个领域,发现有些方法在一个领域有效,在其他领域则会失效。这种差异在只测试单一数据集时不容易显现。
  2. 研究以引用排名和采用率 AUC 为主要指标,衡量竞争条件下模型如何选择来源,而不只是计算答案从某个来源取用了多少文字。
  3. 研究公开了基准、改写后的文档、代码和结果,研究者因而能够复查大规模实验中的负面结果,而不必只依赖个别案例。

这项研究与最初的 GEO 基准确实得出了明显不同的结果,但简单地称之为复现失败并不准确,因为两篇论文在多个方面采用了不同的实验设置:

维度Aggarwal et al. 2024C-SEO Bench 2025较为稳妥的比较结论
主要结果指标标准化词数、根据位置调整权重后的词数,以及主观印象引用排名增益与采用率 AUC改写可能增加答案取用某个来源文字的比例,却无法稳定提高引用排名
竞争设置主要让一份优化后的来源与其他未改写来源竞争随机选择一份目标文档,并测试采用率从 10% 增至 100% 时的结果率先采用时带来的提升,不等于可以长期维持的竞争优势
任务GEO-bench 中的问题回答产品推荐与问题回答不能把推荐任务中的效果推广到问题回答任务
领域约 10,000 条查询,来自九个基准数据源六个划分明确的领域,共 1,921 条查询和 16,360 条记录新研究测试了不同的领域组合,并且领域划分更明确
模型原研究开展时可用的生成式引擎与模型四个指定的 2024–2025 年专有 API 模型版本两篇论文都不能给出在所有模型上始终成立的固定效果值
能够支持的结论部分改写提高了该研究采用的可见度指标多数被测改写都未能在不同情形下重复提高引用排名新研究提高了声称一种方法普遍有效时应满足的证据标准

若要准确理解这套基准,而不是把它误读为对 GEO 的全面否定,还需要注意五项限制。

第一,两项研究采用的评估指标不同。引用排名固然有用,但它不能反映某个来源的文字在答案中占多少篇幅、引用能否支持事实、品牌是否被提及或用户是否转化。C-SEO Bench 也指出,其引用排名结果不一定与早期研究的词数结果冲突。综合两项研究时,应当比较同类指标,不能只挑选符合既定立场的数字。

第二,检索顺序基线只提供了间接证据。手动把文档放在第一位,可以证明回答模型会受到输入位置的影响,却不能证明改写标题、建设链接、添加结构化数据或采用其他搜索优化方法,能够在真实索引中取得同等幅度的效果。

第三,实验设置决定了结论很难直接推广到基准之外。四个专有模型版本只能依据固定的候选集作答。ChatGPT Search、Perplexity 和 Google AI Overviews 等完整产品还会进行查询改写、抓取、排序、去重、安全处理和引用呈现,也会受到产品自身策略的影响,这些环节都不在实验范围内。模型提供方还可能在指定版本发布后调整模型行为。

第四,实验覆盖的语言和上下文条件较为有限。基准只测试英文内容,而且所有文档都能完整放入模型可用的上下文。长文被截断、跨语言检索、生成过程中的摘要处理,以及不同文化背景下对可信度的判断方式,都可能改变实验结果。

第五,实验测试的方法有限。十种白帽改写不能代表所有内容优化、技术优化或分发方法。论文也没有评估传统检索优化和 C-SEO 改写结合使用时会产生什么效果。负面结果既不能证明未来出现的方法必然无效,也不能用于判断实验未涉及的操纵手段。

另外两项研究有助于解释这些结果的可能成因,但不能作为 C-SEO Bench 的直接证据。Wan 等人发现,模型在相互冲突的来源之间作选择时,主题相关性比科学引用、中立语气等形式上的可信度信号更重要。这与通用风格改写作用较弱的现象一致,但 Wan 研究的是另一类偏好判断任务,使用的模型也更早。Nestaas 等人发现,对抗性偏好操纵会使多方参与者陷入囚徒困境,与竞争优势逐渐消失的现象相似。不过,他们研究的是黑帽提示注入攻击,不同于这里的白帽改写。

因此,稳妥的结论不是全盘否定 GEO,而是要求研究提供更严格的证据:应当分别报告方法在不同任务、领域、模型、基线位置和采用率下的效果。C-SEO Bench 所否定的,是把单方实验测得的最佳效果当成普遍规律;它也由此提高了 GEO 相关主张需要满足的实证标准。

7. 可复现性:研究者能重跑哪些部分

官方公开的材料足以支持 code-and-data 评级,包括基准记录、生成的文档版本、实验笔记本(notebook)、评估代码和结果存档。这些材料尤其便于复查负面结果。不过,整套实验依赖的外部环境会随时间变化,研究者也无法通过一条命令完整复现所有结果。

资产可获取性许可重跑限制
最终论文NeurIPS 论文集出版方访问条件方法与结果应以最终版本为准
代码与实验笔记本官方 GitHub 仓库MIT研究者需要自行配置运行环境;仓库中未发现带标签的正式版本
基准数据官方 Hugging Face 数据集数据卡首页标注 Apache-2.0上游数据集各自适用不同许可,其中 Multi-News 的使用受到限制
改写文档与结果官方结果数据集数据卡首页标注 Apache-2.0数据量较大,使用时必须选取与目标实验设置对应的数据
模型访问OpenAI 与 Anthropic API提供方条款精确重跑需要付费 API 密钥,而且指定的历史版本必须仍然可用
依赖仓库中的 requirements 与项目配置各软件包许可不同核心依赖的版本已经锁定,部分实验笔记本使用的工具尚未锁定;README 与项目配置对 Python 版本的要求也不一致

代码许可和数据卡标注的许可需要分别核对。代码采用 MIT 许可;基准数据卡首页标注 Apache-2.0,但论文附录列出的上游语料分别适用不同许可,Multi-News 尤其受到仅限研究或非商业用途等条件约束。复用数据时,应逐项核对各来源的许可,不能认为数据卡上的许可已经取代所有上游条件。

能否精确复现,还取决于商业 API 和历史模型是否继续可用。利用公开材料,研究者可以核查改写方法、复用已经发布的输出、重新计算统计结果,并重跑大部分流程;但公开材料无法保证模型提供方服务端的推理行为始终不变。因此,代码和数据确实可以获取,但不能由此断言研究者今后仍能以相同成本得到完全相同的输出。

8. 给从业者的启示:先解决检索问题,再把改写作为实验

对实践而言,要点是持续测量可见度,不要把提高可见度简化为一套普遍适用的写作规则。

  1. 确认内容能够进入候选集。检查内容能否被抓取和索引、是否与主题相关,以及是否满足进入候选集的条件。如果文档根本没有被检索到,无论怎样改写都无法参与引用竞争。
  2. 记录改写前的表现。按任务和领域划分查询,记录内容在不同引擎、模型或产品中的呈现情况;如果可以观察到检索位置,还应分别记录引用排名上升、下降和不变的比例。
  3. 进行受控改写。尽量保持候选集和评测提示词不变,每次只改变一项明确的内容属性。无论是补充准确证据、调整结构、添加摘要,还是进行其他实质性改进,都应视为需要验证的假设,不能预先认定有效。
  4. 在竞争条件下重新测试。模型更新后需要重测,竞争者采用相似写法后也需要重测。不能把率先采用时取得的提升直接用于估算长期回报。

这套实验方案并没有否认准确的统计数据、原创研究、清晰结构或可验证引用的价值。C-SEO Bench 测量的是引用排名变化,无法涵盖优质内容所带来的全部价值。统计数据即使不能提高回答模型给出的引用排名,也可能帮助读者核实信息、作出决定;某个来源即使没有排在引用首位,也可能为相关事实提供更充分的依据。

这一区别也有助于准确理解可引用性的作用。表述清楚、无需依赖上下文就能理解的主张,以及可以追溯出处的证据,都能让模型更容易使用一段内容。这些是参与引用竞争的必要条件,却不能保证排名上升。广义的 GEO 实践还要处理内容能否被技术系统访问、是否与检索需求相关、实体是否清楚、证据质量是否可靠,以及内容分发与效果测量。C-SEO Bench 表明,一套通用的改写指令不能代替这些工作。

团队还应完整保留负面结果。假设 60% 的查询结果没有变化、15% 下降、25% 上升,如果只报告那 25% 的上升结果,就会造成方法普遍有效的错误印象。这套基准最值得借鉴的做法,是报告完整的结果分布、对重复检验进行校正,并继续观察竞争者采用同类方法后,原有效果能否保持。

9. 延伸阅读

常见问题

C-SEO Bench 是否证明对话式 SEO 无效?
没有。它只能说明:在这套基准中,十种具体的白帽内容改写无法稳定提高引用排名,其中几种还经常使排名变差。实验没有覆盖所有 GEO 方法、线上搜索产品的完整检索系统或非英文内容,也没有测量长期流量和收入。
为什么它与 Aggarwal 等人的 GEO 原始论文结论不同?
两项研究采用的指标和实验方案不同。Aggarwal 等人主要衡量答案中有多少文本取自某个来源,并根据这些文本的位置加权;C-SEO Bench 衡量引用排名,还纳入产品推荐任务、六个领域、指定模型版本和多份文档同时采用改写的情形。因此,新结果质疑的是将早期发现广泛推广的做法。由于两项研究的实验条件并不完全相同,不能把这种差异视为严格意义上的复现失败。
上下文位置影响很强,是否证明传统 SEO 一定胜过 GEO?
不能。研究人员手动调整已经进入模型上下文的文档顺序,由此证明输入顺序会影响结果;但实验没有测试任何一种技术 SEO 或内容 SEO 方法,无法说明它们能否在真实搜索引擎中产生相同的排序变化。
“模型引导”是否证明公开部署 llms.txt 能提高可见度?
不能。实验人员直接把生成的 Markdown 摘要放在回答模型上下文的最前面,没有测试爬虫能否发现、抓取、解析或遵循网站公开的 llms.txt 文件,因此这项结果不能验证公开部署 llms.txt 是否有效。
C-SEO Bench 的实验可以复现吗?
作者公开了以 MIT 许可发布的代码、官方基准数据集、改写后的文档和结果数据,因此可归为 code-and-data。若要精确重跑实验,仍需付费使用 OpenAI 与 Anthropic API、能够调用指定的历史模型版本,并处理部分未锁定的依赖项和上游数据集许可。

相关工作

参考来源

一手来源

  1. C-SEO Bench: Does Conversational SEO Work? (NeurIPS 2025 proceedings) · NeurIPS 2025 Datasets and Benchmarks Track
  2. C-SEO Bench: Does Conversational SEO Work? (arXiv) · arXiv · 2025-06-06
  3. C-SEO Bench official code repository · Parameter Lab / GitHub
  4. C-SEO Bench official benchmark dataset · Parameter Lab / Hugging Face
  5. C-SEO Bench official experiment results · Parameter Lab / Hugging Face

二手来源

  1. GEO: Generative Engine Optimization (Aggarwal et al. 2024) · arXiv / KDD 2024
  2. Evaluating Verifiability in Generative Search Engines (Liu et al. 2023) · Association for Computational Linguistics
  3. What Evidence Do Language Models Find Convincing? (Wan et al. 2024) · Association for Computational Linguistics
  4. Adversarial Search Engine Optimization for Large Language Models (Nestaas et al. 2025) · ICLR 2025
最近更新: 2026-08-19 作者: Ray Yang 主题: 生态