跳到正文

大型语言模型的检索增强生成综述(Gao 等,2023)

速览要点

原文标题
Retrieval-Augmented Generation for Large Language Models: A Survey
作者
Yunfan Gao, Yun Xiong, Xinyu Gao, Kangxiang Jia, Jinliu Pan, Yuxi Bi, Yi Dai, Jiawei Sun, Meng Wang, Haofen Wang
发表信息
arXiv (v1 2023; v5 2024)
年份
2023
DOI
10.48550/arXiv.2312.10997
链接
https://arxiv.org/abs/2312.10997
可复现性
代码与数据均未公开
综述范围
论文称其覆盖 100 多项研究、26 类任务和近 50 个数据集
系统框架
论文将 RAG 分为 Naive、Advanced、Modular 三种范式,并从检索、生成、增强、评测四个方面展开讨论
证据的适用范围
这是一篇叙述性综述;论文没有开展原创基准实验,也没有考察生产引擎或测试 GEO 干预方法

通俗摘要

Gao 等人没有把检索增强生成(RAG)简化为向量搜索的一项附加功能,而是将其作为完整系统来讨论。综述先介绍最基本的索引、检索和生成流程,再说明 Advanced RAG 如何改进查询和证据筛选,以及 Modular RAG 如何灵活组合搜索、记忆、调度与模型适配。时至今日,这套系统框架仍是论文最重要的贡献:检索、生成、增强和评测彼此关联,但仍需分别处理。需要注意的是,论文总结的是当时的研究进展,并不是受控实验,也没有测试生产搜索引擎或 GEO 方法。

关键发现

  • 综述将系统架构分为 Naive RAG、Advanced RAG、Modular RAG 三种范式;这种分类便于理解设计差异,但三者并非严格互斥的成熟度等级。
  • RAG 的质量不只取决于检索。索引、查询转换、重排、上下文压缩、模型适配和何时增强,都可能改变最终答案。
  • 检索与生成必须分开评测。检索结果与问题相关,不代表回答忠于证据;回答正确,也可能掩盖检索效果不佳或证据不足的问题。
  • 作者称综述覆盖 100 多项研究、26 类任务和近 50 个数据集;这些数字统计的是论文写作期间纳入的研究,并不代表当前领域的研究总量。
  • 对 GEO 而言,这篇论文解释了系统如何检索、筛选外部来源并用其生成答案,但没有测试引用可见度、内容优化或任何线上生成式搜索产品。
  • 这套分类至今仍适合作为讨论系统设计的共同术语框架;智能体控制、生产环境评测、长上下文调度、多模态检索和安全问题则需要参考更新的证据。

1. 这篇综述提供了什么:一套完整的 RAG 系统框架

Retrieval-Augmented Generation for Large Language Models: A Survey 系统梳理了一个快速演进的工程领域。Gao 等人称其覆盖 100 多项研究、26 类任务和近 50 个数据集。这些数字统计的是论文写作期间纳入的研究,不能视为持续更新的 RAG 研究总量。

检索增强生成(Retrieval-Augmented Generation,RAG)让语言模型在生成答案之前或生成过程中,从可以更新的外部知识源检索信息。仅依赖参数记忆存在几项局限:事实会过时,模型掌握的专业知识可能不够全面,只靠模型权重生成的答案也难以追溯来源。奠定基础的 NeurIPS 2020 RAG 论文 把序列生成器与 Wikipedia 稠密索引结合起来;Gao 等人则把讨论范围从单一模型方案扩大到完整的 生成式引擎架构。

这一区分对生成式引擎优化很重要。GEO 依赖系统发现、筛选和使用外部来源,但了解这些机制并不能直接证明某种优化方法有效。

这篇综述做了什么没有做什么对 GEO 的价值
梳理 RAG 范式、组件与评测方法没有逆向分析线上搜索产品说明系统从发现外部来源到最终显示来源标注,需要经过哪些环节
汇总既有研究结果没有自行开展一套受控基准实验便于区分用于解释系统机制的证据与用于检验方法效果的证据
建立一套讨论系统设计时共用的术语没有测试内容改写或引用可见度避免根据检索结果直接判断答案最终是否会显示来源

2. RAG 的基本机制:索引、检索、生成

论文将基本流程分为三个阶段。系统先把文档切分成可检索的内容块(chunk)并建立索引;收到查询(query)后,通过检索(retrieval)选出一个较小的候选集;生成器再同时读取问题和经过筛选的上下文,据此生成答案。

文档 -> [索引] -> 可检索内容块
                     |
查询 -> [检索] -> 候选集(排名前 k 的内容块)
                     |
               [筛选 / 采信] -> 入选上下文
                     |
                  [生成] -> 答案

这里需要区分三类信息。参数记忆(parametric memory)储存在模型权重中;外部知识库是可搜索的语料;查询时上下文(query-time context)则是模型此次实际收到的一小部分内容。即使不修改模型权重,只更新语料库,也可能改变后续回答,但前提是新增内容能够被系统发现、检索,并在筛选时保留下来。

实际系统往往会反复执行这些步骤。系统可能重写查询、多次搜索、重排候选结果、压缩上下文,并在发现证据不足时再次检索。RAG 指的是系统架构;Answer Loop描述的是一次请求中各环节的运行顺序。

阶段输入需要做出的决定可能影响后续环节的问题
索引来源文档系统应将哪些单元和元数据编入索引缺失、过时或语义不完整的内容块不会成为候选内容
检索查询与索引哪些内容块进入候选集召回率不足会漏掉证据,精确率不足会增加噪声
筛选候选内容块系统应把哪些证据提供给生成器重排或压缩可能删掉有用段落
生成查询与上下文模型应如何根据证据组织答案模型可能忽略、曲解或夸大证据

3. 三种 RAG 范式:Naive、Advanced、Modular

3.1 Naive RAG

Naive RAG 是论文所说的三步基线:索引、检索、生成。这里的 Naive 是架构分类,并非断言所有简单实现的质量都很低。只要语料经过仔细筛选,且查询足够准确,简单流程也可能很有效;即使增加更多组件,也无法保证系统不出错。

输入处理输出常见问题
文档按固定方式切分并建立索引形成可搜索的语料库切分位置可能截断证据或丢失语境
用户查询只检索一次得到排名前 k 的段落精确率或召回率可能不足,候选内容也可能相互冲突
查询与段落只生成一次得到自然语言答案答案可能出现幻觉、无关内容或偏见,也可能没有正确使用证据

Gao 等人从检索、生成和增强三方面总结了基础流程的不足。检索可能漏掉相关段落,也可能返回造成干扰的内容。生成器可能忽略证据,在证据冲突尚未解决时直接照搬其中的内容,也可能过分依赖证据。有些复杂问题必须先读取初步材料,才能确定接下来需要解决哪些子问题,因此只检索一次并不够。

3.2 Advanced RAG

Advanced RAG 会同时改进检索前后的处理。检索前,系统改善索引质量和查询表达,以便更准确地识别相关内容;检索后,系统在生成器读取内容之前滤除噪声。重点不在于增加组件,而在于提高候选结果的质量,并减少提供给生成器的无关内容。

位置技术类别要解决的问题
检索前:语料调整内容块策略、补充元数据、建立分层索引避免证据被截断、缺少语境或难以筛选
检索前:查询重写、扩展、拆解查询,或按意图分类解决用户用语与语料用语不匹配的问题
检索前:表示调整嵌入模型,融合稀疏检索与稠密检索避免相似度计算漏掉精确词语或语义上的匹配
检索后:排序对结果重排,并筛除相关性较低的内容避免排名前 k 的结果看似相关,实际提供的证据却较弱
检索后:上下文删除重复内容并压缩上下文减少提示中的重复、冲突和篇幅过长等问题

这些处理也需要权衡。过度压缩可能删掉限定条件;扩展查询可以提高召回率,也可能偏离原意;重排器还会引入新的排序偏好,而这些偏好往往难以解释。因此,Advanced 这一分类只表明系统提供了更多可调环节,并不等于质量必然更高。

3.3 Modular RAG

Modular RAG 将搜索、记忆、任务分派、结果融合、预测和任务适配分别设计为可以组合的模块。各模块可以按固定顺序运行,也可以在满足特定条件时多次调用,或由系统动态决定如何组合。系统能够选择信息源、继续发起查询、合并结果,并根据中间结果决定是否停止。

范式流程何时检索检索后处理模型适配典型局限
Naive按线性顺序处理生成前检索一次很少进行检索后处理通常不适配模型一次检索失误就容易使整个流程失效
Advanced在线性流程中加入改进措施通常用转换后的查询检索一次对结果重排、筛选和压缩可选择进行模型适配处理阶段更多,调优工作量和延迟也会增加
Modular组合多个模块,并按条件执行可以只检索一次,也可以反复、递归或自适应检索具体方式取决于采用的模块可通过提示、适配器或联合训练来适配模型控制过程复杂,错误来源难以定位

后来的智能体系统和深度研究系统延续了这种模块化思路,但 2024 年的综述并未完整描述今天的智能体 RAG 分类。此后发表的智能体 RAG 综述进一步讨论了反思、规划、工具使用、多智能体协作和明确的控制结构。这些内容扩展了 Modular 的思路,但不能视为 Gao 等人已经讨论过的内容。

4. 三个技术方面:检索、生成、增强

4.1 检索:哪些内容能进入候选集

检索涉及语料、查询及两者的表示方式。内容块的粒度和元数据会影响哪些材料与查询匹配;查询重写与任务分派决定系统检索什么;稀疏检索能够保留词语的精确匹配,稠密检索关注语义相似度,混合方法则试图兼顾两者。

影响因素预期收益设置不当时的问题
内容块大小与重叠既保留足以回答问题的证据,也保留必要语境片段太小会导致语义不完整,太大则会降低相关信息所占的比例
元数据与层级让系统能按来源、时间、章节或实体筛选内容元数据缺失或错误会使系统无法筛选出优质证据
查询重写使用户用语与语料用语相匹配重写后的查询可能偏离用户的原始意图
稀疏、稠密或混合检索同时兼顾精确词语匹配和语义召回采用单一表示方式,可能漏掉另一种方式能够识别的匹配信息
检索器适配使排序更符合具体任务和生成器的需要即使离线评测显示相关性有所提高,最终答案的质量也未必改善

较高的检索召回率是必要条件,却不是充分条件。排名前 k 的相关内容块仍可能在后续处理中被舍弃或截短,也可能与其他证据冲突,或被模型忽略。反过来,即使检索失败,模型也可能依靠参数记忆给出正确答案。仅看端到端准确率,无法判断检索与生成各自表现如何。

4.2 生成:系统保留了哪些内容,又如何使用这些内容

检索后的筛选决定系统会把哪些候选内容纳入提示。生成器适配则会影响模型能否依据证据作答、整合多个段落、拒绝回答语料无法支持的问题,或转而依靠参数记忆。

系统先从索引中找出候选来源,再将其中一部分提供给生成器;生成器可能只采用部分证据,产品界面也可能不显示相应的来源标注。因此,检索到了某个来源,不代表生成器一定看到了它;生成器看到了,也不代表答案一定采用了它;答案采用了其中的信息,界面也不一定标明来源。Gao 等人详细解释了前几个环节,至于是否显示来源,则取决于产品如何呈现答案以及采用何种来源标注规则。因此,引用与提及必须分开测量。

状态发生了什么可观察结果
系统检索到来源系统将该来源列入候选集在受控系统之外通常无法观察
系统向模型提供来源文本系统将部分来源文本纳入模型上下文系统记录可以显示这一过程,但答案不一定采用这些文本
答案采用来源证据答案中的内容依赖这份证据可以通过来源归因分析或反事实分析判断
界面标明来源界面显示来源名称或链接用户可以看到链接、引用标记或提及

由此可见,即使答案有证据支持,界面显示的来源也不一定准确对应答案所依据的材料。系统可能严格依据证据作答,却不显示来源名称;也可能把某个包含相关说法的页面列为来源,但没有证据表明答案确实采用了该页面的内容。

4.3 增强:检索什么、何时检索、如何检索

增强涉及三个相互独立的问题:应该补充什么知识,应在模型生命周期的哪个阶段引入外部知识,以及系统是否需要反复检索或动态调整检索方式。这三项属于不同的分类维度,并不表示系统会按成熟度从低到高依次发展。

维度综述列出的选项设计问题
阶段预训练、微调、推理应在什么阶段利用外部知识来影响模型行为?
来源非结构化文本、结构化数据、模型生成材料任务需要哪种知识形态,又应达到什么可信程度?
过程一次、反复、递归、自适应只检索一次是否足够,还是应根据已有证据调整下一次查询?

这些区分可以避免两种过度简化。RAG 不等同于向量搜索,因为知识来源可以是结构化数据,检索器也可以采用词法检索或混合检索。RAG 也不一定只在推理阶段临时补充信息:检索可以用于训练或适配模型,论文还认为 RAG 与微调可以配合使用。

5. 评测:必须把检索与生成分开衡量

5.1 评测对象与系统应具备的能力

综述分别评测检索质量与生成质量。检索评测通过上下文相关性与召回率判断系统是否找到了有用证据;生成评测则通过忠实度与回答相关性判断输出是否有证据支持、是否回答了用户真正提出的问题。

评测对象所需能力代表性指标
检索找到有用证据,同时避免无关内容占据提示上下文相关性、精确率、召回率
生成确保回答中的关键说法都有给定证据支持忠实度或采信度
端到端回答回答用户实际提出的问题回答相关性与任务准确率
鲁棒性不受无关或误导性上下文影响噪声鲁棒性
拒答对语料库无法支持的问题拒绝作答对无依据问题的拒答能力
综合从多个段落提取并整合证据信息整合能力
冲突处理不盲从外部提供的错误说法反事实鲁棒性

与单一的问答正确率相比,这些能力更能反映 RAG 系统的实际风险。论文也承认,当时还没有成熟、统一的 RAG 专用评测方法。后来的评测综述以相关性、准确性和忠实度为基础整理出统一流程,同时再次指出现有指标与基准的局限。

5.2 论文中的基准与工具

Gao 等人列出若干代表性基准与评测框架,以说明当时采用了哪些研究方法。论文纳入的内容截至 2024 年 3 月,因此这张表反映的是当时的研究情况,并不是今天的工具推荐榜。

基准或工具综述中的主要评测对象在当时研究中的作用
RGB噪声、拒答、信息整合与反事实鲁棒性测试检索上下文如何改变模型行为
RECALL反事实与知识冲突行为检验模型依赖检索知识还是参数知识
CRUD创建、读取、更新与删除任务把评测范围扩展到问答之外
RAGAS检索与生成指标可以不使用参考答案,也可以借助模型分别评测各个组件
ARES上下文相关性、忠实度、回答相关性使用经过训练的评判模型自动评测
TruLens运行记录与反馈函数根据实际运行记录检查 RAG 应用

评测框架的作用是帮助团队定位问题。指标下降时,团队需要判断问题来自语料库、检索器、筛选器、生成器还是评测器。单一综合分可能掩盖两种相反情况:检索失败后模型仍给出正确答案,或答案看似流畅却建立在错误证据上。

5.3 这套评测还缺少哪些 GEO 结果

RAG 评测关注系统是否找到了有用的上下文,以及生成的回答是否切题并忠于证据。GEO 还需要评测发布者可观察到的结果:系统是否检索并采用了页面内容,最终是否显示来源名称、链接或醒目的引用标记。两类结果有所重叠,但不能彼此替代。

系统质量结果发布者可见的结果
系统找到了相关上下文系统将某个具体页面列入候选集或引用来源清单
回答忠实于上下文页面被标明为来源后,其中相应段落确实支持答案中的说法
回答切中查询答案中会显示发布者的链接、引用标记或名称,也可能完全不标明来源
系统能够抵抗噪声证据的干扰系统没有以质量较低的竞争来源取代发布者页面

正因如此,RAG 基准得分的提高不能直接换算成引用份额。评测不仅要判断系统是否正确,还要确认答案是否标明具体来源,以及所标明的来源是否确实支持相应内容。

6. GEO Wiki 评析:分类仍有参考价值,证据限于早期研究

6.1 这套框架至今仍可怎样使用

这篇综述将复杂领域整理成一套便于交流的概念框架,使人们可以用同一组术语讨论实现方式差异很大的系统。

贡献为什么至今仍有价值今天使用时的限制
Naive → Advanced → Modular 的范式分类清楚呈现不同系统具备怎样的控制能力,以及如何组合组件类别之间可能重叠,并不是严格的成熟度等级
从检索、生成、增强三个方面分析系统避免把 RAG 简化为向量搜索如今还需要在框架中更明确地讨论安全与多模态问题
分别评测各个组件找出端到端准确率所掩盖的问题对生产环境如何标明来源,仍然缺少充分评测

这套分类还揭示了一项重要的工程结论:引入检索能扩展系统能力,也会带来新的失效方式。过时索引、被污染的来源、查询偏移、重排偏见、上下文冲突和评测失真,都可能在系统从接收查询到生成答案的过程中发生。RAG 改变了知识的来源,却不会自动保证知识质量。

6.2 2026 年阅读这篇综述时需要注意的四项限制

这篇综述系统整理了 2023 年至 2024 年初的研究,但将这些结论用于此后的系统时,必须明确适用条件。

读者可能推断的说法证据限制更准确的表述
这就是当前完整的 RAG 研究格局。综述主要纳入截至 2024 年初的文献这套框架适合用于理解基础系统,但还需要结合后续研究。
RAG 能减少幻觉。综述汇总了多项不同研究,并不是一项统一实验在特定语料、检索器和评测设置下,RAG 可能让回答更有事实依据。
Naive、Advanced、Modular 互不重叠。这些标签同时涉及时间演进、组件数量、处理流程与适配方式它们是理解设计差异的范式,也可以共存于同一系统。
生产环境中的答案引擎采用的就是这套流程。各产品使用自有的索引、重排器、策略与来源标注机制公开的产品行为符合部分 RAG 机制,但不能据此认定其技术栈完全相同。

首先要注意论文纳入研究的时间范围。智能体搜索、深度研究流程、多模态检索、长上下文调度,以及生产环境中使用网页作为证据的做法,都在论文最后一次修订后迅速发展。理解这些变化需要参考后续证据,不能把后来出现的内容说成原论文已经提出。

第二,综述不是实验。论文汇总的研究使用了不同任务、语料、模型和指标,因此无法给出 RAG 减少幻觉的普遍效应量,也没有测试任何 GEO 内容干预。

第三,这套分类同时涉及多个维度。Advanced 可能指更好的预处理、更强的后处理或模型适配;Modular 既可能指组件可以替换,也可能指系统能更灵活地控制处理流程。这套框架很适合用来梳理研究,却不能作为严格的分类标准。

第四,实验室研究与生产系统之间仍有距离。目前各产品只公开了部分运行方式。Google 表示,其生成式搜索功能以核心排序系统为基础,并可能同时发出多个查询(官方指南)。 OpenAI 表示,ChatGPT search 可能把一个请求改写为多个定向查询,也提醒用户引用可能不完整或有误(官方帮助)。两份官方说明都没有公开完整的索引、重排、上下文筛选或来源标注规则。

6.3 哪些判断仍然成立,哪些需要新证据

原综述的一些核心判断至今仍成立,另一些则因系统发展而需要新证据。

2024 年综述中的判断2026 年状态还需要什么新证据
无需重新训练权重,只更新外部知识也能改变答案这一判断仍然成立需要了解生产语料多久更新一次,以及系统如何建立索引
系统可以反复检索或自适应调整检索这一判断仍然成立,并已发展出由智能体控制检索的方式需要研究智能体 RAG 架构及其运行故障
重排与压缩会改变检索后的结果这一判断仍然成立需要生产系统的重排记录,并检查系统如何筛选上下文
检索与生成必须分开评测这一判断仍然成立需要开展线上动态评测,并分别衡量每个来源的表现
RAG 可以与微调结合这一判断仍然成立需要针对具体任务比较成本、延迟和维护负担
RAG 是处理长输入的默认方案这一判断需要限定适用条件需要比较长上下文与 RAG,并测试混合调度方法
大多数 RAG 设计都以文本检索为主这一判断需要更新需要多模态检索基准与来源追溯方法
安全只是众多未来问题之一如今应当提高安全问题的优先级需要测试内容污染、访问控制、提示注入与数据泄漏

长上下文的取舍就是一例。Li 等人的 EMNLP 2024 研究发现,在算力和上下文资源充足的测试条件下,长上下文模型的平均表现更好,而 RAG 的成本低得多;混合调度方法则以更低成本保持了相近表现。这个结果并不意味着长上下文会取代 RAG,而是说明应根据具体任务与资源选择方案。

后续研究还补充了关于评测与来源偏好的证据。2024 年的评测综述把相关性、准确性和忠实度分别用于评估检索与生成。 Wan 等人的冲突证据实验则显示,当两个来源都已进入候选集后,主题相关性可能比若干写作风格上的可信度信号更重要。这两项研究分别考察了 Gao 等人未实际测量的评测问题与来源偏好。

7. 可复现性与配套材料

这是一篇叙述性综述,没有原创基准实验可供复现。因此,可复现性标为 none,意思是这类研究不包含可供复现的实验设计,并不表示论文没有配套材料。

材料用途对可复现性的意义
arXiv v1–v5保存论文各个版本的历史记录可以确认本文讨论的内容对应 2024 年 3 月版本
RAG-Survey 官方仓库提供引用格式、幻灯片和项目链接可以核对来源,但不能用来复现实验
OpenRAG Base整理论文、任务、数据集、工具与阅读材料它是持续维护的知识库,并不是实验代码与数据包

不同来源的元数据存在一处明显差异。当前 arXiv 记录列出十位作者,v1 发布于 2023 年 12 月 18 日,v5 发布于 2024 年 3 月 27 日;官方仓库提供的 2024 年 BibTeX 条目还包括 Qianyu Guo。作者字段采用当前 arXiv 记录中的名单,同时注明仓库中的差异,没有直接合并两份名单。

8. 对 GEO 从业者意味着什么

从 GEO 视角看,RAG 的运行过程可以分为几个明确环节。系统先发现页面并将其编入索引,再从中检索出相关内容单元,并在上下文长度限制下进行重排和筛选;生成器还要在答案中实际采用这些内容,产品的来源标注机制才可能显示相应来源。

机制可观察层面的含义不能由此证明的说法
索引与内容切分页面的可抓取性,以及段落是否连贯、能否回答问题,都会影响系统是否将页面列为候选来源每个引擎都会实时抓取页面
候选检索查询相关性和语料表示会影响系统是否将该页面列入候选集仅做关键词匹配就足够
重排与筛选来源质量和段落与问题的相关程度可能影响系统是否保留这些内容一种通用内容格式能适配所有重排器
基于证据生成表述清楚且彼此不冲突的证据更容易被模型采用答案采用了页面中的证据,就一定会显示可见引用
来源标注产品界面决定是否显示链接或来源名称引用标记前后的每一项说法都确实得到被引页面的支持

这套模型有助于判断可抓取性、内容与问题的相关程度、内容块连贯性和来源质量分别影响哪个环节,但没有给出相应效应量。 Answer Loop可以用来追踪一次请求中各环节的运行情况,但不能据此断定某种方法有效;检索完成后,还必须单独测量系统是否给出引用与提及

若要判断具体内容干预是否有效,可参照 Aggarwal 等人 2024。Gao 等人的综述解释了 GEO 所依赖的基础机制, Aggarwal 等人则在特定生成式引擎基准中测试了内容改写。机制研究无法替代干预实验,干预实验也不能说明整套系统如何工作。

9. 延伸阅读

常见问题

Gao 等人的 RAG 综述最主要的贡献是什么?
它为 RAG 建立了一套连贯的术语框架。论文区分 Naive、Advanced、Modular 三种范式,再从检索、生成、增强和评测四方面梳理相关技术。这篇综述的主要价值在于系统梳理了一个复杂领域,而不在于提出某个新的性能数字。
Gao 等人是否证明 RAG 能减少幻觉?
没有。论文汇总了采用不同任务、数据集和系统设计的研究结果,并未通过一组受控实验证明 RAG 在所有情形下都能减少幻觉。检索也可能带来无关、过时、相互冲突或带有攻击性的证据。
最新版本发布于 2024 年,为什么仍标为 2023 年论文?
arXiv 记录的首次提交日期是 2023 年 12 月 18 日,之后持续修订,v5 发布于 2024 年 3 月 27 日。结构化数据沿用首次发布年份 2023,同时明确标注版本历史;官方仓库的 BibTeX 则使用 2024 年。
这篇综述是否说明 ChatGPT Search 或 Google AI 功能如何排列来源?
没有。它讨论的是通用 RAG 研究架构。生产引擎可能同时使用搜索索引、查询拆分、重排、长上下文、模型工具、策略模块和自有的来源标注机制;论文并未考察生产引擎具体如何组合这些组件。
GEO 从业者应该如何使用这篇论文?
可以借助这套框架分析页面内容为何没有进入答案、页面为何没有获得引用:系统可能未发现页面并将其编入索引,可能未在检索时将其列为候选来源,也可能在重排和筛选时没有保留其中的信息,或在生成答案时没有采用这些信息;即使采用了,最终也可能没有显示来源。但不能据此认定某种改写、结构化数据字段或内容方法一定会提高引用率。

相关工作

参考来源

一手来源

  1. Retrieval-Augmented Generation for Large Language Models: A Survey · arXiv · 2023-12-18
  2. RAG-Survey — official repository and OpenRAG supporting materials · Tongji-KGLLM / GitHub
  3. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks · NeurIPS 2020
  4. Optimizing your website for generative AI features on Google Search · Google Search Central · 2026-07-10
  5. Searching the web with ChatGPT · OpenAI Help Center

二手来源

  1. Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG · arXiv
  2. Evaluation of Retrieval-Augmented Generation: A Survey · arXiv
  3. Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid Approach · Association for Computational Linguistics
  4. GEO: Generative Engine Optimization (Aggarwal et al. 2024) · arXiv / KDD 2024
  5. What Evidence Do Language Models Find Convincing? (Wan, Wallace, Klein 2024) · Association for Computational Linguistics
最近更新: 2026-08-20 作者: Ray Yang 主题: 生态