跳到正文

什么样的证据能说服语言模型?(Wan 等,2024)

速览要点

原文标题
What Evidence Do Language Models Find Convincing?
作者
Alexander Wan, Eric Wallace, Dan Klein
发表信息
ACL 2024 Main (Long Papers, pp. 7468–7484)
年份
2024
DOI
10.18653/v1/2024.acl-long.403
链接
https://arxiv.org/abs/2402.11782
可复现性
代码与数据均公开
数据基础
ConflictingQA:238 道有争议问题,2,208 段检索证据,MIT 许可证
测试对象
GPT-4(1106-preview)、Claude Instant v1,以及 LLaMA-2、Vicuna、WizardLM 三款 13B 模型,均为 2024 年年中以前的版本
核心结论
查询相关性主导偏好;科学引用与中立语气的影响接近于零,甚至略为负向

通俗摘要

Wan、Wallace 与 Klein 将两份真实网页成对提供给语言模型。两份页面对同一个有争议的问题持相反立场(例如「阿斯巴甜是否致癌」),研究者据此衡量哪些因素会让模型偏向其中一份。结果与常见认识相反:人类通常看重的风格化可信度信号,例如科学引用、中立语气、正式引用格式,对模型偏好几乎没有影响;真正起决定作用的是内容与查询的相关性,也就是页面回答问题时有多直接、多具体。受测的五个模型包括 GPT-4、Claude Instant,以及三款 13B 开源模型;结果趋势在所有模型上都一致,因此这并不只是小模型才有的现象。

关键发现

  • 对于风格化可信度信号,人类偏好与 LLM 偏好几乎没有对应关系:在论文测试的范围内,增加科学引用和补充更多信息这两类改写,对 LLM 偏好的影响为中性,甚至略为负向;尽管人类读者明确表示自己看重这些特征。
  • 真正起决定作用的是查询相关性。问题前缀(Question Prefix)这种做法,也就是在段落前面加一句对问题的重述,对所有受测模型的胜率都带来了最强的正向影响。
  • 五个模型的结果方向一致:开源 13B 模型 LLaMA-2 Chat、Vicuna v1.5、WizardLM v1.2,以及商用前沿模型 GPT-4、Claude Instant,结果都指向同一结论,并不是小模型才有的偏差。
  • 对于有争议、没有单一正确答案的查询,检索语料的质量比提示词(prompt)工程更重要:语料中未被过滤的事实错误,模型不会代为复核。
  • 论文给出的是效应方向与效应排序,主要见 Figure 2 的柱状图和 Figure 4 的散点图;并未提供带置信区间的点估计百分比。任何「某项改写带来 X 个百分点提升」的说法,其数字都来自对图表的读取,并不是论文直接给出的可引用结果。

1. 这篇论文讲什么,以及它逼出的一次反转

主流 GEO 建议大多基于一个未经明说的假设:只要通过作者署名、引用、中立语气、schema 标记、统计数据等方式让页面「看起来可信」,LLM 选择来源时就更可能选中它。What Evidence Do Language Models Find Convincing?(Wan、Wallace、Klein,UC Berkeley,ACL 2024)是第一篇严谨量化这一假设的论文,也是第一篇直接挑战这一假设的论文。

他们把两份对同一个有争议问题持相反观点的真实网页同时提供给 LLM,并观察模型的选择。结果显示,模型主要依据查询相关性做选择,也就是页面回答问题时有多直接、多具体;至于人类明确表示最看重的风格化可信度信号(科学引用、中立语气、正式引用格式),几乎不影响模型的选择。

这一结论令人不安,因为业内的主流做法恰好与之相反。同时必须明确,论文的适用范围比标题所示更窄:这项反事实研究只在 ConflictingQA 数据集上测试了五个 2023–24 年的 LLM,并不能代表对 2026 年所有上线引擎的全面结论。

2. 它形式化了什么问题

检索增强生成会把多份来源同时提供给模型,让它回答同一个查询。对于有标准答案的事实型查询,已有研究给出了一套解释:模型往往更倾向于与自身参数化先验一致的来源,或者提示词中特别凸显的那一份。但对于有争议的查询(例如「阿斯巴甜是否致癌」「日托对孩子是不是有害」),并没有可以倚靠的「正确答案」,而这恰恰是可信度信号本应发挥最大作用的场合。

Wan 等人的核心做法,是把这种情形转化为成对比较实验:

  • 选一个尚无定论的有争议问题。
  • 给模型两段立场相反的真实网页文字。
  • 问它:你被哪一份说服?

这种设置把「什么让证据有说服力」与「真相到底是什么」分开了。在此基础上,他们又对每一段文字做了反事实改写:删除其中一段的全部科学引用、把另一段重写为中立语气、在段落前面加一句对问题的重述,再观察模型偏好如何随之变化。本论文以检索、提示、引用这套底层采信机制为前提(答案循环(answer loop) 有完整描述),只考察模型偏好这一层的问题。

这套设计衡量的是模型产生偏好的环节,不是检索环节:模型做选择时,两份候选段落都已经提供给它。一段内容能否被检索出来并放进答案,以及检索出来后算引用还是只算提及,是实验刻意保持不变的另外两个环节。Wan 单独考察的问题范围更窄,也更精确:面对两份已经检索到的候选内容,模型会选择哪一份?

3. 方法学:ConflictingQA 与特征空间

数据集 ConflictingQA 取自医学、政治、社会等领域的有争议查询,其特点是检索结果前 N 条网页中往往同时出现立场相反的两种说法:

元素取值
问题数238 道有争议的问题,分属 144 个问题类别
证据段落从网页中检索出的 2,208 段真实内容
比较对其中有 912 段证据各自与至少 5 段立场相反的内容组成比较对,平均每段参与 6.54 组配对
许可MIT,仓库见 github.com/AlexWan0/rag-convincingness
镜像HuggingFace kortukov/ConflictingQA

受测的五个 LLM 既包括开源 13B 模型,也包括商用前沿模型;这一构成对理解 §6 讨论的局限性很重要:

模型类型
GPT-4(gpt-4-1106-preview商用前沿模型
Claude Instant v1商用中端模型
LLaMA-2 Chat 13B开源 13B
Vicuna v1.5 13B开源 13B,基于 Llama-2
WizardLM v1.2 13B开源 13B,基于 Llama-2

论文研究的特征分成两类:

类型所测特征
风格化的可信度信号增加科学引用;改写为中立语气;加入正式引用格式;以「补充更多信息」为目的的扩写;Flesch–Kincaid 可读性分数;独特词数
实质内容与查询的相关性,尤其包括「问题前缀」这种做法,即在段落前面加一句对问题的重述;以及问题与段落的嵌入余弦相似度

实验会为每组段落记录三项结果:(a)人类标注的偏好;(b)模型收到提示后给出的偏好;(c)仅改变其中一段的单个特征后,模型偏好发生的变化。由此可以得到每个特征对应的胜率曲线,论文通过 Figure 2 的柱状图与 Figure 4 的散点图呈现这些结果。

4. 反转细节:什么动了偏好,什么没动

这篇论文最值得关注的是,各项特征对胜率的影响差异极大:

✅ 对 LLM 偏好有显著正向影响❌ 中性、略偏负,或与偏好无关
问题前缀:在段落前面加一句对问题的重述,对全部五个模型的正向影响都最强增加科学引用:加入对科学来源的引用,对胜率的影响接近于零,甚至略为负向
问题与段落的嵌入余弦相似度:除 GPT-4 外,其他模型的胜率都与之高度相关补充更多信息:在同一领域内多写一段文字,并未提高模型偏好
话题具体性:模型更偏好直接回应有争议问题的段落,而不是泛泛介绍背景的段落中立语气:把段落改写成中立、百科式的语气,并不会提高模型偏好
可读性(Flesch–Kincaid):与说服力无关
独特词数:与说服力无关

原文摘要中的一句话最清楚地概括了结论:模型 “rely heavily on the relevance of a website to the query, while largely ignoring stylistic features that humans find important such as whether a text contains scientific references or is written with a neutral tone”

对 GEO 从业者而言,这一结论之所以棘手,是因为业内不少关于 可引用性(citability)E-E-A-T 优化的建议,都默认风格化可信度信号是影响模型信任来源的主要因素。但在 Wan 等人测试的配置中,这类信号的影响很小,真正起主要作用的是话题相关性;本论文是迄今为止设计最清晰的一项反事实研究。

5. 结果细节

下面是论文的主要结论:

发现细节
风格化可信度信号几乎不影响偏好在所测范围内,加入科学引用、把段落改写为中立语气,对 LLM 胜率的影响接近于零,甚至略为负向
查询相关性主导「问题前缀」在所有受测模型上都带来最强的正向效应
不同档位的模型结果方向一致GPT-4、Claude Instant 与三款 13B 开源模型的结果方向一致,并不是小模型才有的偏差
对于有争议的查询,语料质量比提示词更重要语料中未被过滤的错误,模型不会代为复核;候选集中的错误信息会直接进入答案
与人类判断的差距说明训练目标仍需调整作者明确提到「在训练 LLM 的方式上做出调整,以更好地对齐人类判断」,这表明该现象有望通过训练调整来修正,并非模型固有

论文在一点上相当谨慎,但从业者常会忽略:这里得到的是效应方向与效应排序,而不是带置信区间的点估计百分比。Figure 2 的柱状图和 Figure 4 的散点图直接呈现了实验结果。任何「补科学引用带来 X% 提升」之类的说法,都不是论文直接给出的、可以照搬的数字;这类看似精确的数字,大多来自对图表的读取。

6. GEO Wiki 评估

先看它的贡献。以下三点至关重要,至今依然成立:

  1. 第一次把「说服力」拆解为可以分别命名和测量的特征。在此之前,检索增强领域的可信度研究多半停留在「模型是否采纳检索到的来源」这一层,并没有进一步追问来源的哪些特征会影响模型采纳。Wan 等人是第一篇通过反事实扰动逐项测量这些特征的论文。
  2. ConflictingQA 是一份可以复用的公开数据集。238 道有争议问题、2,208 段证据,构建本身就不容易;采用 MIT 许可证并在 GitHub 公开,让后续研究可以直接在此基础上继续推进。例如 Retrieval-Augmented Generation with Conflicting Evidence(Wang 等,arXiv 2504.13079,2025 年 4 月)就直接以 Wan 的冲突证据研究为基础继续推进。
  3. 对语料筛选有直接启示。如果偏好主要由话题相关性决定,而不是由表面可信度信号决定,那么高风险 RAG 首先需要控制的是哪些来源进入候选集,而不是候选来源呈现哪些表面特征。这一结论也与 C-SEO Bench 一致:业内不少基于网页的对话式 SEO 改写,效果都比预期来得小。

以下四项局限也需要明确:

  1. 研究的外部效度有限。受测的五个模型都是 2024 年中以前的版本:GPT-4 是 gpt-4-1106-preview,Claude 是 Instant v1,五个模型中有三个属于同一 Llama-2 谱系的 13B 开源模型。Claude 3.5 / 4、GPT-4o、Gemini、Mistral、LLaMA-3 都未纳入评测。2026 年的读者不能用本论文为今天的 ChatGPT Search、GeminiPerplexityGoogle AI Overviews 提供依据。
  2. 所测特征仅覆盖一部分。论文测试的「可信度信号」只有科学引用、中立语气、正式引用、补充信息、可读性、独特词数这几项。更广义的各类 E-E-A-T 信号,包括经过核验的作者身份、sameAs 关系、来源域名权威度、统计密度、是否带结构化数据等,都未纳入扰动实验。准确的说法是「所测的四项风格化特征几乎不影响五个 2023–24 年模型的偏好」,而不是「可信度对 LLM 都无所谓」。
  3. 与 Aggarwal 的表面矛盾源于测量对象不同Aggarwal 等人(KDD 2024) 显示 Cite Sources 能把 Position-Adjusted Word Count 最高提升 30%,Quotation Addition 最高提升 41%;Wan 的结果则显示,增加科学引用几乎不影响模型偏好。两件事可以同时成立:Aggarwal 测量的是一个来源能否进入合成答案(纳入结果),Wan 测量的是模型在两份已检索出来的来源之间会偏向哪一份(偏好结果)。两篇论文研究的是 答案循环 的不同环节。把它们归并为一个数字,就会丢掉这项区别。
  4. 对原因的解释仍不充分。论文记录了「相关性主导,风格化可信度几乎不影响偏好」这一现象,但没有充分区分几种可能的原因(预训练目标的影响、RLHF 工艺带来的偏差、提示格式对比较任务的扭曲)。厘清这些原因之所以重要,是因为这决定了该现象换用新的训练范式后是否仍会成立,还是只存在于 2023–24 年的模型中。

GEO Wiki 的判定。奠基不等于可以直接照搬。可取的是研究指出的方向:相关性与具体性主导模型偏好,表面可信度信号几乎不影响偏好;但不能把这一结论跨引擎、跨时间外推,并据此制定规划。

7. 可复现性

以下状态均已在撰稿时(2026-05-28)逐项实地核实:

产出物状态
源代码公开:github.com/AlexWan0/rag-convincingness
数据集(ConflictingQA)公开:同一仓库;HuggingFace 第三方镜像 huggingface.co/datasets/kortukov/ConflictingQA
许可MIT
模型同时包括开源权重(LLaMA-2、Vicuna、WizardLM)与付费 API(GPT-4、Claude Instant);其中开源部分可以完全离线复现

字段取值:code-and-data。实验代码与 ConflictingQA 数据集均已公开,因此论文的核心实验可以独立复现。与这一领域的多数论文相比,这是一个实在的优点。

8. 它对从业者意味着什么

这篇论文说明应当调整工作优先级,但并不意味着可以放弃可信度建设:

  • 把内容投入的重点放在直接回答查询上。让一段文字直接、具体地回答那个查询:采用贴合问题的措辞、给出具体细节、在该节开头先用一句话点明主题。在 Wan 等人测试的配置中,这才是最能影响模型偏好的因素。
  • 不是放弃表面可信度,而是让它发挥合适的作用。作者署名、sameAs 关系、schema 标记、来源域名权威度,都未纳入 Wan 的扰动实验。它们仍然可能影响页面在第一步能否被检索到(这是 可引用性 讨论的前置环节),以及被检索之后能否通过 E-E-A-T 的信任筛选。Wan 测试的只是两份来源已经提供给模型后,它会选择哪一份
  • Wan 与 Aggarwal 的结论应结合起来理解Aggarwal 等人 的 Cite Sources、Statistics、Quotation 这类改写之所以有效,部分原因是它们同时提高了相关性:如果问题本来就与数字有关,给段落补充统计数据,就能让它更直接地回应问题。这样理解,两项研究的结论完全相容:Wan 说明哪些类型的内容改写会影响模型偏好(相关性,而不是风格),Aggarwal 则说明,包含实质信息的可信度改写能提高内容被答案纳入的概率,其中一部分正是通过提高相关性发挥作用。
  • 不要把它外推到 2026 年的上线引擎。所测的五个模型都是 2023–24 年的版本。如何把这项优先级调整落实到操作中,见 writing-for-ai-citation;凡是声称「X 已经失效,Y 才是新的重点」,尤其是只用 Wan 一篇论文作为依据的说法,都超出了本论文实际证明的范围。

9. 延伸阅读

  • Aggarwal et al. 2024 — GEO: Generative Engine Optimization:研究来源内容能否进入答案;建议与 §6 第 3 项局限对照阅读,理解两篇论文的结果为什么可以同时成立。
  • Puerto et al. 2025 — C-SEO Bench:对 GEO 方法类文献进行独立复制研究,结果方向相反;但在「语料筛选比调整网页的表面特征更重要」这一判断上与本论文一致。
  • 生成式引擎优化:说明 Wan 提出的优先级调整,在更广义的 GEO 学科中有何意义。
  • E-E-A-T:Wan 只覆盖其中一小部分;建议读完 §6 第 2 项局限后再看这一条。
  • 可引用性:介绍 Wan 实验中假定已经满足的检索前提。

常见问题

这篇论文到底主张什么?
将两份对同一个有争议问题持相反立场的真实网页提供给 LLM,并让它选择其中一份时,主要决定因素是内容与查询的相关性,也就是页面回答问题时有多直接。至于人类看重的几项风格化可信度信号,例如增加科学引用、改用中立语气、采用正式引用格式,几乎不影响模型的选择。这一结果在五个模型上方向一致,从开源 13B 模型到 GPT-4 和 Claude Instant 都成立。
这是不是意味着 LLM 不在意 E-E-A-T?
不是,这正是最容易被过度解读的地方。Wan 等人测试的是四项具体的风格化特征,对象是五个 2023–24 年的模型。更广义的各类 E-E-A-T 信号(作者身份、sameAs 关系、来源域名权威度、统计密度等)都未纳入实验的扰动范围。准确的说法是:所测的四项可信度信号几乎不影响这些模型的偏好;而不是「可信度对 LLM 都无所谓」。
它和 Aggarwal 等人(KDD 2024)的 Cite Sources 结论矛盾吗?
表面上矛盾,但两项研究的测量对象不同。Aggarwal 测量的是增加引用后,一个页面在合成答案中被引用的概率如何变化;Wan 测量的是增加引用后,模型对两份已经检索出来的网页会偏向哪一份。两件事处在不同环节,可以同时成立。
从业者拿到这个结论应该怎么做?
内容投入的重点应放在直接、具体地回答查询上:采用贴合问题的措辞、给出具体细节、用一句话正面概括该节主题;不要把权威感的外在形式视为在两个候选页面之间胜出的主要手段。表面可信度信号仍可能影响内容能否被检索到;Wan 测试的只是两份来源已经提供给模型后,它会选择哪一份。
数据集和代码可以拿到吗?
可以。代码与 ConflictingQA 数据集都在 github.com/AlexWan0/rag-convincingness,采用 MIT 许可证;HuggingFace 上还有一份第三方数据集镜像(kortukov/ConflictingQA)。论文的核心实验可以独立复现。

相关工作

参考来源

一手来源

  1. What Evidence Do Language Models Find Convincing? (Wan, Wallace, Klein 2024) · arXiv / ACL 2024 Main · 2024-02-19
  2. What Evidence Do Language Models Find Convincing? (ACL Anthology) · Association for Computational Linguistics · 2024-08-11
  3. ConflictingQA — official code and data repository (rag-convincingness) · Alexander Wan / GitHub

二手来源

  1. ConflictingQA — third-party HuggingFace mirror · HuggingFace
  2. GEO: Generative Engine Optimization (Aggarwal et al. 2024) · arXiv / KDD '24
  3. C-SEO Bench: Does Conversational SEO Work? (Puerto et al. 2025) · arXiv / NeurIPS '25 D&B
  4. Evaluating Verifiability in Generative Search Engines (Liu et al. 2023) · arXiv / EMNLP '23 Findings
  5. Retrieval-Augmented Generation with Conflicting Evidence (Wang et al. 2025) · arXiv
最近更新: 2026-05-28 作者: Ray Yang 主题: 生态