什么样的证据能说服语言模型?(Wan 等,2024)
速览要点
- 原文标题
- What Evidence Do Language Models Find Convincing?
- 作者
- Alexander Wan, Eric Wallace, Dan Klein
- 发表信息
- ACL 2024 Main (Long Papers, pp. 7468–7484)
- 年份
- 2024
- DOI
- 10.18653/v1/2024.acl-long.403
- 链接
- https://arxiv.org/abs/2402.11782
- 可复现性
- 代码与数据均公开
- 数据基础
- ConflictingQA:238 道有争议问题,2,208 段检索证据,MIT 许可证
- 测试对象
- GPT-4(1106-preview)、Claude Instant v1,以及 LLaMA-2、Vicuna、WizardLM 三款 13B 模型,均为 2024 年年中以前的版本
- 核心结论
- 查询相关性主导偏好;科学引用与中立语气的影响接近于零,甚至略为负向
通俗摘要
Wan、Wallace 与 Klein 将两份真实网页成对提供给语言模型。两份页面对同一个有争议的问题持相反立场(例如「阿斯巴甜是否致癌」),研究者据此衡量哪些因素会让模型偏向其中一份。结果与常见认识相反:人类通常看重的风格化可信度信号,例如科学引用、中立语气、正式引用格式,对模型偏好几乎没有影响;真正起决定作用的是内容与查询的相关性,也就是页面回答问题时有多直接、多具体。受测的五个模型包括 GPT-4、Claude Instant,以及三款 13B 开源模型;结果趋势在所有模型上都一致,因此这并不只是小模型才有的现象。
关键发现
- 对于风格化可信度信号,人类偏好与 LLM 偏好几乎没有对应关系:在论文测试的范围内,增加科学引用和补充更多信息这两类改写,对 LLM 偏好的影响为中性,甚至略为负向;尽管人类读者明确表示自己看重这些特征。
- 真正起决定作用的是查询相关性。问题前缀(Question Prefix)这种做法,也就是在段落前面加一句对问题的重述,对所有受测模型的胜率都带来了最强的正向影响。
- 五个模型的结果方向一致:开源 13B 模型 LLaMA-2 Chat、Vicuna v1.5、WizardLM v1.2,以及商用前沿模型 GPT-4、Claude Instant,结果都指向同一结论,并不是小模型才有的偏差。
- 对于有争议、没有单一正确答案的查询,检索语料的质量比提示词(prompt)工程更重要:语料中未被过滤的事实错误,模型不会代为复核。
- 论文给出的是效应方向与效应排序,主要见 Figure 2 的柱状图和 Figure 4 的散点图;并未提供带置信区间的点估计百分比。任何「某项改写带来 X 个百分点提升」的说法,其数字都来自对图表的读取,并不是论文直接给出的可引用结果。
1. 这篇论文讲什么,以及它逼出的一次反转
主流 GEO 建议大多基于一个未经明说的假设:只要通过作者署名、引用、中立语气、schema 标记、统计数据等方式让页面「看起来可信」,LLM 选择来源时就更可能选中它。What Evidence Do Language Models Find Convincing?(Wan、Wallace、Klein,UC Berkeley,ACL 2024)是第一篇严谨量化这一假设的论文,也是第一篇直接挑战这一假设的论文。
他们把两份对同一个有争议问题持相反观点的真实网页同时提供给 LLM,并观察模型的选择。结果显示,模型主要依据查询相关性做选择,也就是页面回答问题时有多直接、多具体;至于人类明确表示最看重的风格化可信度信号(科学引用、中立语气、正式引用格式),几乎不影响模型的选择。
这一结论令人不安,因为业内的主流做法恰好与之相反。同时必须明确,论文的适用范围比标题所示更窄:这项反事实研究只在 ConflictingQA 数据集上测试了五个 2023–24 年的 LLM,并不能代表对 2026 年所有上线引擎的全面结论。
2. 它形式化了什么问题
检索增强生成会把多份来源同时提供给模型,让它回答同一个查询。对于有标准答案的事实型查询,已有研究给出了一套解释:模型往往更倾向于与自身参数化先验一致的来源,或者提示词中特别凸显的那一份。但对于有争议的查询(例如「阿斯巴甜是否致癌」「日托对孩子是不是有害」),并没有可以倚靠的「正确答案」,而这恰恰是可信度信号本应发挥最大作用的场合。
Wan 等人的核心做法,是把这种情形转化为成对比较实验:
- 选一个尚无定论的有争议问题。
- 给模型两段立场相反的真实网页文字。
- 问它:你被哪一份说服?
这种设置把「什么让证据有说服力」与「真相到底是什么」分开了。在此基础上,他们又对每一段文字做了反事实改写:删除其中一段的全部科学引用、把另一段重写为中立语气、在段落前面加一句对问题的重述,再观察模型偏好如何随之变化。本论文以检索、提示、引用这套底层采信机制为前提(答案循环(answer loop) 有完整描述),只考察模型偏好这一层的问题。
这套设计衡量的是模型产生偏好的环节,不是检索环节:模型做选择时,两份候选段落都已经提供给它。一段内容能否被检索出来并放进答案,以及检索出来后算引用还是只算提及,是实验刻意保持不变的另外两个环节。Wan 单独考察的问题范围更窄,也更精确:面对两份已经检索到的候选内容,模型会选择哪一份?
3. 方法学:ConflictingQA 与特征空间
数据集 ConflictingQA 取自医学、政治、社会等领域的有争议查询,其特点是检索结果前 N 条网页中往往同时出现立场相反的两种说法:
| 元素 | 取值 |
|---|---|
| 问题数 | 238 道有争议的问题,分属 144 个问题类别 |
| 证据段落 | 从网页中检索出的 2,208 段真实内容 |
| 比较对 | 其中有 912 段证据各自与至少 5 段立场相反的内容组成比较对,平均每段参与 6.54 组配对 |
| 许可 | MIT,仓库见 github.com/AlexWan0/rag-convincingness |
| 镜像 | HuggingFace kortukov/ConflictingQA |
受测的五个 LLM 既包括开源 13B 模型,也包括商用前沿模型;这一构成对理解 §6 讨论的局限性很重要:
| 模型 | 类型 |
|---|---|
GPT-4(gpt-4-1106-preview) | 商用前沿模型 |
| Claude Instant v1 | 商用中端模型 |
| LLaMA-2 Chat 13B | 开源 13B |
| Vicuna v1.5 13B | 开源 13B,基于 Llama-2 |
| WizardLM v1.2 13B | 开源 13B,基于 Llama-2 |
论文研究的特征分成两类:
| 类型 | 所测特征 |
|---|---|
| 风格化的可信度信号 | 增加科学引用;改写为中立语气;加入正式引用格式;以「补充更多信息」为目的的扩写;Flesch–Kincaid 可读性分数;独特词数 |
| 实质内容 | 与查询的相关性,尤其包括「问题前缀」这种做法,即在段落前面加一句对问题的重述;以及问题与段落的嵌入余弦相似度 |
实验会为每组段落记录三项结果:(a)人类标注的偏好;(b)模型收到提示后给出的偏好;(c)仅改变其中一段的单个特征后,模型偏好发生的变化。由此可以得到每个特征对应的胜率曲线,论文通过 Figure 2 的柱状图与 Figure 4 的散点图呈现这些结果。
4. 反转细节:什么动了偏好,什么没动
这篇论文最值得关注的是,各项特征对胜率的影响差异极大:
| ✅ 对 LLM 偏好有显著正向影响 | ❌ 中性、略偏负,或与偏好无关 |
|---|---|
| 问题前缀:在段落前面加一句对问题的重述,对全部五个模型的正向影响都最强 | 增加科学引用:加入对科学来源的引用,对胜率的影响接近于零,甚至略为负向 |
| 问题与段落的嵌入余弦相似度:除 GPT-4 外,其他模型的胜率都与之高度相关 | 补充更多信息:在同一领域内多写一段文字,并未提高模型偏好 |
| 话题具体性:模型更偏好直接回应有争议问题的段落,而不是泛泛介绍背景的段落 | 中立语气:把段落改写成中立、百科式的语气,并不会提高模型偏好 |
| 可读性(Flesch–Kincaid):与说服力无关 | |
| 独特词数:与说服力无关 |
原文摘要中的一句话最清楚地概括了结论:模型 “rely heavily on the relevance of a website to the query, while largely ignoring stylistic features that humans find important such as whether a text contains scientific references or is written with a neutral tone”。
对 GEO 从业者而言,这一结论之所以棘手,是因为业内不少关于 可引用性(citability) 与 E-E-A-T 优化的建议,都默认风格化可信度信号是影响模型信任来源的主要因素。但在 Wan 等人测试的配置中,这类信号的影响很小,真正起主要作用的是话题相关性;本论文是迄今为止设计最清晰的一项反事实研究。
5. 结果细节
下面是论文的主要结论:
| 发现 | 细节 |
|---|---|
| 风格化可信度信号几乎不影响偏好 | 在所测范围内,加入科学引用、把段落改写为中立语气,对 LLM 胜率的影响接近于零,甚至略为负向 |
| 查询相关性主导 | 「问题前缀」在所有受测模型上都带来最强的正向效应 |
| 不同档位的模型结果方向一致 | GPT-4、Claude Instant 与三款 13B 开源模型的结果方向一致,并不是小模型才有的偏差 |
| 对于有争议的查询,语料质量比提示词更重要 | 语料中未被过滤的错误,模型不会代为复核;候选集中的错误信息会直接进入答案 |
| 与人类判断的差距说明训练目标仍需调整 | 作者明确提到「在训练 LLM 的方式上做出调整,以更好地对齐人类判断」,这表明该现象有望通过训练调整来修正,并非模型固有 |
论文在一点上相当谨慎,但从业者常会忽略:这里得到的是效应方向与效应排序,而不是带置信区间的点估计百分比。Figure 2 的柱状图和 Figure 4 的散点图直接呈现了实验结果。任何「补科学引用带来 X% 提升」之类的说法,都不是论文直接给出的、可以照搬的数字;这类看似精确的数字,大多来自对图表的读取。
6. GEO Wiki 评估
先看它的贡献。以下三点至关重要,至今依然成立:
- 第一次把「说服力」拆解为可以分别命名和测量的特征。在此之前,检索增强领域的可信度研究多半停留在「模型是否采纳检索到的来源」这一层,并没有进一步追问来源的哪些特征会影响模型采纳。Wan 等人是第一篇通过反事实扰动逐项测量这些特征的论文。
- ConflictingQA 是一份可以复用的公开数据集。238 道有争议问题、2,208 段证据,构建本身就不容易;采用 MIT 许可证并在 GitHub 公开,让后续研究可以直接在此基础上继续推进。例如 Retrieval-Augmented Generation with Conflicting Evidence(Wang 等,arXiv 2504.13079,2025 年 4 月)就直接以 Wan 的冲突证据研究为基础继续推进。
- 对语料筛选有直接启示。如果偏好主要由话题相关性决定,而不是由表面可信度信号决定,那么高风险 RAG 首先需要控制的是哪些来源进入候选集,而不是候选来源呈现哪些表面特征。这一结论也与 C-SEO Bench 一致:业内不少基于网页的对话式 SEO 改写,效果都比预期来得小。
以下四项局限也需要明确:
- 研究的外部效度有限。受测的五个模型都是 2024 年中以前的版本:GPT-4 是 gpt-4-1106-preview,Claude 是 Instant v1,五个模型中有三个属于同一 Llama-2 谱系的 13B 开源模型。Claude 3.5 / 4、GPT-4o、Gemini、Mistral、LLaMA-3 都未纳入评测。2026 年的读者不能用本论文为今天的 ChatGPT Search、Gemini、Perplexity 或 Google AI Overviews 提供依据。
- 所测特征仅覆盖一部分。论文测试的「可信度信号」只有科学引用、中立语气、正式引用、补充信息、可读性、独特词数这几项。更广义的各类 E-E-A-T 信号,包括经过核验的作者身份、sameAs 关系、来源域名权威度、统计密度、是否带结构化数据等,都未纳入扰动实验。准确的说法是「所测的四项风格化特征几乎不影响五个 2023–24 年模型的偏好」,而不是「可信度对 LLM 都无所谓」。
- 与 Aggarwal 的表面矛盾源于测量对象不同。Aggarwal 等人(KDD 2024) 显示 Cite Sources 能把 Position-Adjusted Word Count 最高提升 30%,Quotation Addition 最高提升 41%;Wan 的结果则显示,增加科学引用几乎不影响模型偏好。两件事可以同时成立:Aggarwal 测量的是一个来源能否进入合成答案(纳入结果),Wan 测量的是模型在两份已检索出来的来源之间会偏向哪一份(偏好结果)。两篇论文研究的是 答案循环 的不同环节。把它们归并为一个数字,就会丢掉这项区别。
- 对原因的解释仍不充分。论文记录了「相关性主导,风格化可信度几乎不影响偏好」这一现象,但没有充分区分几种可能的原因(预训练目标的影响、RLHF 工艺带来的偏差、提示格式对比较任务的扭曲)。厘清这些原因之所以重要,是因为这决定了该现象换用新的训练范式后是否仍会成立,还是只存在于 2023–24 年的模型中。
GEO Wiki 的判定。奠基不等于可以直接照搬。可取的是研究指出的方向:相关性与具体性主导模型偏好,表面可信度信号几乎不影响偏好;但不能把这一结论跨引擎、跨时间外推,并据此制定规划。
7. 可复现性
以下状态均已在撰稿时(2026-05-28)逐项实地核实:
| 产出物 | 状态 |
|---|---|
| 源代码 | 公开:github.com/AlexWan0/rag-convincingness |
| 数据集(ConflictingQA) | 公开:同一仓库;HuggingFace 第三方镜像 huggingface.co/datasets/kortukov/ConflictingQA |
| 许可 | MIT |
| 模型 | 同时包括开源权重(LLaMA-2、Vicuna、WizardLM)与付费 API(GPT-4、Claude Instant);其中开源部分可以完全离线复现 |
字段取值:code-and-data。实验代码与 ConflictingQA 数据集均已公开,因此论文的核心实验可以独立复现。与这一领域的多数论文相比,这是一个实在的优点。
8. 它对从业者意味着什么
这篇论文说明应当调整工作优先级,但并不意味着可以放弃可信度建设:
- 把内容投入的重点放在直接回答查询上。让一段文字直接、具体地回答那个查询:采用贴合问题的措辞、给出具体细节、在该节开头先用一句话点明主题。在 Wan 等人测试的配置中,这才是最能影响模型偏好的因素。
- 不是放弃表面可信度,而是让它发挥合适的作用。作者署名、sameAs 关系、schema 标记、来源域名权威度,都未纳入 Wan 的扰动实验。它们仍然可能影响页面在第一步能否被检索到(这是 可引用性 讨论的前置环节),以及被检索之后能否通过 E-E-A-T 的信任筛选。Wan 测试的只是两份来源已经提供给模型后,它会选择哪一份。
- Wan 与 Aggarwal 的结论应结合起来理解。Aggarwal 等人 的 Cite Sources、Statistics、Quotation 这类改写之所以有效,部分原因是它们同时提高了相关性:如果问题本来就与数字有关,给段落补充统计数据,就能让它更直接地回应问题。这样理解,两项研究的结论完全相容:Wan 说明哪些类型的内容改写会影响模型偏好(相关性,而不是风格),Aggarwal 则说明,包含实质信息的可信度改写也能提高内容被答案纳入的概率,其中一部分正是通过提高相关性发挥作用。
- 不要把它外推到 2026 年的上线引擎。所测的五个模型都是 2023–24 年的版本。如何把这项优先级调整落实到操作中,见 writing-for-ai-citation;凡是声称「X 已经失效,Y 才是新的重点」,尤其是只用 Wan 一篇论文作为依据的说法,都超出了本论文实际证明的范围。
9. 延伸阅读
- Aggarwal et al. 2024 — GEO: Generative Engine Optimization:研究来源内容能否进入答案;建议与 §6 第 3 项局限对照阅读,理解两篇论文的结果为什么可以同时成立。
- Puerto et al. 2025 — C-SEO Bench:对 GEO 方法类文献进行独立复制研究,结果方向相反;但在「语料筛选比调整网页的表面特征更重要」这一判断上与本论文一致。
- 生成式引擎优化:说明 Wan 提出的优先级调整,在更广义的 GEO 学科中有何意义。
- E-E-A-T:Wan 只覆盖其中一小部分;建议读完 §6 第 2 项局限后再看这一条。
- 可引用性:介绍 Wan 实验中假定已经满足的检索前提。
常见问题
这篇论文到底主张什么?
这是不是意味着 LLM 不在意 E-E-A-T?
它和 Aggarwal 等人(KDD 2024)的 Cite Sources 结论矛盾吗?
从业者拿到这个结论应该怎么做?
数据集和代码可以拿到吗?
相关工作
参考来源
一手来源
- What Evidence Do Language Models Find Convincing? (Wan, Wallace, Klein 2024) · arXiv / ACL 2024 Main · 2024-02-19
- What Evidence Do Language Models Find Convincing? (ACL Anthology) · Association for Computational Linguistics · 2024-08-11
- ConflictingQA — official code and data repository (rag-convincingness) · Alexander Wan / GitHub
二手来源
- ConflictingQA — third-party HuggingFace mirror · HuggingFace
- GEO: Generative Engine Optimization (Aggarwal et al. 2024) · arXiv / KDD '24
- C-SEO Bench: Does Conversational SEO Work? (Puerto et al. 2025) · arXiv / NeurIPS '25 D&B
- Evaluating Verifiability in Generative Search Engines (Liu et al. 2023) · arXiv / EMNLP '23 Findings
- Retrieval-Augmented Generation with Conflicting Evidence (Wang et al. 2025) · arXiv