一、研究背景与问题
研究动机:大语言模型(LLM)存在“幻觉”问题,即生成与事实不符的内容。检索增强生成(RAG)通过引入外部知识库来缓解这一问题,但现有方法存在明显不足:
-
传统RAG:将文档视为孤立单元,难以处理需要综合多处分散信息的多跳查询(Multi-hop QA)。
-
现有GraphRAG:虽能利用知识图谱的拓扑结构进行多跳推理,但依赖LLM进行实体和关系提取,带来两大问题——计算开销巨大(图构建耗时、成本高)和易出错(LLM提取可能产生幻觉、噪声或遗漏,导致错误级联传播)。
核心目标:提出一个既高效又准确的图增强RAG框架,在不牺牲多跳推理能力的前提下,大幅降低计算成本和延迟。
二、提出的方法:TIGRAG
TIGRAG(Token-Induced GraphRAG)是一个基于令牌共现知识图谱的轻量级图增强RAG框架。其核心创新在于用统计共现替代LLM驱动的图构建。
整体架构(两阶段)
-
离线图构建阶段:
-
将文档分割成重叠的句子级文本块(滑动窗口策略)。
-
对每个块进行令牌化、去停用词、过滤短令牌和标点。
-
构建加权无向图:节点为有效令牌,边的权重基于令牌在滑动窗口内的共现频率。整个过程无需任何LLM参与,完全基于统计。
-
-
在线推理阶段(单跳+多跳):
-
查询预处理:将用户查询令牌化,取与图节点重合的令牌作为种子节点。
-
语义扩展(PPR):在图上运行个性化PageRank(PPR),从种子节点出发探索拓扑邻域,得到扩展令牌集及其归一化分数。
-
候选检索与图加权评分:检索包含扩展令牌的文本块,用BM25结合PPR分数计算混合相关性得分。
-
动态候选池化:用累积分数阈值动态筛选出最相关的块,避免固定截断带来的噪声。
-
神经重排序:用嵌入模型计算查询与候选块的余弦相似度,重新排序,得到单跳检索结果。
-
-
多跳迭代机制(核心创新):
-
从第一跳检索到的Top块中,通过命名实体识别(NER)提取命名实体。
-
用这些实体扩展原始查询(仅保留新实体,避免循环)。
-
用扩展后的查询重复图检索和重排序过程。
-
最多执行2跳(经实验验证),最后合并各跳结果,取每个块在所有跳中的最大相似度分数作为最终排序依据,输出Top-β个块作为上下文送给LLM生成答案。
-
三、实验设置
-
数据集:HotpotQA、2WikiMultiHopQA、MuSiQue(三个多跳问答基准),各取1,000个查询。
-
基线方法:NaiveRAG、RAPTOR、GraphRAG、LightRAG、ToG、KGP、HippoRAG2,以及NoRAG。
-
评估指标:
-
检索:Recall@2、Recall@5
-
生成:精确匹配(EM)、令牌级F1
-
效率:离线索引时间、在线端到端推理延迟、提示词元占用(上下文长度)
-
四、主要实验结果
1. 检索性能(表2)
TIGRAG在所有数据集上一致最优:
-
在HotpotQA上,R@2达78.60%,比NaiveRAG提升9.70%;R@5达92.05%,提升8.23%。
-
在2WikiMultiHopQA上,R@2达72.98%,R@5达87.20%,均显著优于所有基线。
-
在最难的MuSiQue上,R@2达42.57%,比HippoRAG2提升19.92%。
2. 问答生成性能(表3)
-
TIGRAG在HotpotQA上EM达60.70%(+13.67% vs NaiveRAG),F1达72.60%(+11.97%)。
-
在2WikiMultiHopQA上EM达50.90%,F1达58.60%,均为最优。
-
在MuSiQue上,F1最高(35.80%),EM略低于HippoRAG2(26.20% vs 26.50%),但F1更高说明TIGRAG能提供更全面、更可靠的证据。
3. 计算效率(表4、表5)——最大亮点
-
离线索引:TIGRAG仅需约200秒,而GraphRAG需数十万秒,LightRAG需数十万至百万秒。TIGRAG比最快的图基线RAPTOR快约150倍。
-
在线推理:TIGRAG每查询仅需3~4秒,而NaiveRAG需23~64秒(在复杂数据集上TIGRAG更快),比RAPTOR快约4倍。
-
提示词元占用:TIGRAG上下文约1,300~1,460个令牌,与GraphRAG相当,远小于LightRAG(~4,000)和NaiveRAG(~3,200~3,800),既节省计算又减少LLM分心。
4. 消融与敏感性分析(表6~10)
-
最优块数β=5(过多引入噪声,过少证据不足)。
-
最优跳数h=2(超过3跳无增益)。
-
最优候选池阈值thρ=0.8(保证足够候选多样性)。
-
PPR驱动扩展远优于简单度中心性,神经重排序和BM25均有显著贡献。
五、核心贡献总结
| 维度 | 具体贡献 |
|---|---|
| 方法创新 | 首次提出完全基于令牌共现统计的图增强RAG,无需LLM参与图构建,从根本上避免了提取错误和高成本。 |
| 检索能力 | 通过PPR语义扩展+BM25加权+动态池化+神经重排序,在三个多跳基准上取得最优的Recall和生成F1。 |
| 多跳推理 | 设计迭代式实体驱动查询扩展机制,利用NER从已检索块中提取新实体来扩展查询,有效捕获分散证据。 |
| 效率优势 | 离线索引时间比现有GraphRAG方法降低2~3个数量级;在线推理延迟比最快图基线快4倍;提示占用紧凑,减少LLM分心。 |
| 可扩展性 | 轻量级设计使其适合大规模、实时部署。 |
六、局限性与未来工作
-
局限性:
-
依赖NER质量,实体提取错误可能导致语义漂移。
-
仅捕获基于共现的邻近关系,对隐含语义关联建模不足。
-
仅处理纯文本,未涉及多模态。
-
-
未来方向:
-
引入语义边连接词汇不同但语义相似的令牌。
-
引入语义感知节点处理多义词消歧。
-
扩展至多模态(图像、视频)场景。
-
TIGRAG通过令牌共现图替代昂贵的LLM图构建,实现了检索精度优于现有GraphRAG、计算效率接近甚至超过简单密集检索的突破,为高效、可扩展的多跳RAG提供了新的范式。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

摘要
检索增强生成(RAG)通过将生成过程锚定在外部知识上,缓解了大语言模型(LLM)的幻觉问题。然而,标准的RAG方法在处理多跳推理时面临困难。尽管最近的基于图的RAG方法改进了对相互关联的文本块的检索,但它们通常依赖于计算成本高昂且容易出错的、基于LLM的提取流水线。为解决这些问题,我们提出了TIGRAG(Token-Induced GraphRAG),一个基于令牌共现知识图的高效图增强RAG框架。TIGRAG直接使用滑动窗口共现统计来建模令牌之间的拓扑关系,从而实现了可扩展的图构建。在推理过程中,它结合了基于图的语义扩展和神经重排序,以检索用于多跳推理的相互关联的证据。具体而言,它引入了一种迭代的、由实体驱动的检索策略,该策略使用从先前检索到的上下文中提取的桥接实体来逐步扩展查询。我们在三个广泛采用的多跳问答(QA)基准上评估了TIGRAG。实验结果表明,我们的框架在检索和下游QA任务上均持续优于密集检索和基于图的RAG方法,同时大幅减少了索引时间、推理延迟和提示词元占用。
关键词: 检索增强生成,知识图谱,多跳
1. 引言
随着大语言模型(LLM)日益普及,研究界对其固有的脆弱性,特别是幻觉现象,给予了越来越多的关注[30, 47]。检索增强生成(RAG)已成为一种成熟的方法,通过将LLM的输出锚定在外部事实性知识上来缓解幻觉问题[8, 29, 3]。在标准的RAG流水线中,用户查询被编码为向量,然后用于通过相似性搜索从大型文档语料库中检索相关的文本块[27, 17]。检索到的信息随后用于在生成过程中为LLM提供上下文证据[21, 23, 48]。然而,传统的基于向量的RAG系统效率不高,因为它们将文档视为大致不连贯的单元,这限制了它们跨多条信息进行推理的能力。因此,它们经常在处理多跳查询时遇到困难,而多跳查询需要综合分布在独立文本块中的分散证据[2, 38, 26, 49]。
为了解决这个问题,图增强RAG(GraphRAG)方法依赖于结构化表示,通常形式化为知识图谱(KG)。在知识图谱中,节点和边捕获文本元素及其复杂的关系,从而提供了一个拓扑空间来映射和导航知识[5, 11]。这些方法的范围从将图派生的知识(如三元组或社区摘要)直接注入上下文[5],到使用拓扑结构作为路由机制来检索最相关的原始文本块[13]。由于其互联结构,GraphRAG方法能够固有地处理多跳问答(QA)所需的复杂推理路径[33, 19]。然而,两个关键挑战阻碍了它们的更广泛采用。首先,离线KG构建会带来显著的计算开销和延迟[28, 4]。其次,传统的GraphRAG流水线[5, 11]严重依赖基于LLM的实体和关系提取,使其容易受到幻觉、噪声或缺失连接的影响。这些图构建错误可能会在检索流水线中传播,并最终导致下游推理和生成的级联故障[9]。
本文旨在通过提出TIGRAG(Token-Induced GraphRAG)来解决这些计算开销和基于提取的脆弱性问题,TIGRAG是一种高效的图增强RAG。与传统的GraphRAG系统不同,TIGRAG通过从语料库中提取令牌并根据滑动窗口内的共现关系将它们链接起来,从而统计地构建其拓扑基础。TIGRAG的架构包括四个核心组件:(i)一个离线图提取阶段,高效地构建拓扑知识图谱;(ii)一个由个性化PageRank(PPR)驱动的语义扩展和候选检索模块[14];(iii)一个用于上下文块评估的动态图加权评分机制;以及(iv)一个最终的神经重排序模块,根据与查询的语义对齐来筛选出最优的文本块。
2. 相关工作
本节阐述与TIGRAG相关的方法。具体而言,第2.1小节介绍标准RAG方法。第2.2小节描述结构增强检索方法。最后,第2.3小节讨论基于网络的检索和多跳推理范式。
2.1. 标准检索增强生成
RAG已成为限制LLM幻觉的关键范式。它将LLM的输出锚定在可靠且最新的外部知识源上,从而提高了事实准确性和响应质量[6]。
在这一既定范式内,传统的RAG框架通常使用词汇搜索[32]或语义相似性[20]来检索必要的上下文。这些方法将文本块编码为连续向量,并应用相似性度量(如余弦相似性)来有效检索与输入查询具有语义重叠的文档。然而,标准的RAG方法将文档视为孤立的单元。因此,它们在处理需要综合来自不同文本信息的复杂多跳查询时存在显著困难。实际上,在这种情况下,它们受到初始问题与远程支持事实之间词汇和语义差距的限制[2, 38]。
此外,标准的密集检索方法通常检索过长的上下文,导致严重的信息冗余和大量的计算开销。为解决此问题,近期研究探索了上下文剪枝技术。例如,AttentionRAG [7] 引入了一种注意力引导的压缩机制,以减少词元消耗并过滤掉检索段落中的无关信息。虽然上下文压缩提供了部分补救措施,但它通常难以在压缩率和信息丢失风险之间取得平衡。因此,需要一种更具结构性的解决方案来准确识别相互关联的证据,而不仅仅是压缩平面文本。
2.2. 结构增强检索方法
为克服平面向量空间的局限性,近期方法已将结构依赖性整合到RAG流水线中。在此背景下,GraphRAG已成为一种有前景的范式,它利用基于图的索引和检索来挖掘实体间的关系。这使得能够对复杂知识库进行更精确和具备上下文感知的推理[29]。
基于此范式,已经提出了几种特定的架构。例如,RAPTOR [35] 通过迭代抽象处理将文本知识组织成递归树结构,有助于在不同粒度级别进行检索。类似地,TreeRAG [39] 通过采用基于树的组块和双向遍历策略来解决长文档中常见的碎片化问题。这种方法在检索过程中严格保留了层次依赖关系。
同时,基于图的系统因其通过层次化索引和摘要来改进信息聚合的能力而受到广泛关注[34]。GraphRAG [5] 利用知识图谱生成层次化的社区级摘要,而LightRAG [11] 将图拓扑与双级向量表示相结合,以高效检索实体和关系。诸如 KG2RAG [50] 和 HyperGraphRAG [24] 等方法通过分别使用知识图谱和超图表示来利用结构化的块间关系,从而丰富检索到的信息。此外,GFMRAG [25] 引入图基础模型,以深度结构感知能力直接增强生成过程。ToG [36] 将来自结构化知识图谱和非结构化文本的信息检索无缝集成,采用紧密耦合的推理机制来锚定生成过程。KGP [42] 通过构建段落级知识图谱并部署基于LLM的遍历代理,明确针对多文档问答(MD-QA)。这种双重机制在相互关联的文档间调节转换空间,同时动态收集相关上下文,从而在检索延迟和生成质量之间取得平衡。
这些方法中有许多是有效的,但它们依赖于计算成本高昂的、由LLM驱动的提取流水线或广泛的结构预训练来构建其底层图[45]。此外,近期研究表明,像GraphRAG这样的实现在现实世界的大规模部署中遇到了显著的可扩展性问题。在这些场景中,图遍历算法的计算复杂性和检索延迟随着知识图谱大小的增加而呈指数级增长[29]。
TIGRAG直接从标准化文本令牌及其局部共现关系中构建一个高度可遍历的知识图谱。这种精简的方法绕过了生成式图构建的高昂计算成本,确保了高效、低延迟的检索操作,同时保留了语料库固有的结构完整性。
2.3. 基于网络的检索和多跳推理
虽然许多方法侧重于构建知识索引以实现更好的摘要,但另一条研究路线强调直接使用图拓扑来检索相互关联的上下文[18, 43]。例如,GRAG [16] 结合文本和拓扑信息来精确定位相关的子图,而KG-RAG [22] 则采用显式的查询分解和多跳知识图谱检索来实现深度推理。然而,基于图的检索方法经常面临粒度权衡问题[44]。事实上,细粒度的实体级图可以捕获详细的关系,但计算成本高昂且可能丢失上下文信息。相反,粗略的文档级图保留了上下文,但难以建模复杂的多跳关系。近期方法,如QCG-RAG [44],通过构建以查询为中心的图来检索不同粒度级别的相关块来解决此问题。其他方法则依靠图神经网络(GNN)和查询感知的注意力机制,从知识图谱中动态识别和聚合相关信息[1]。
除了依赖显式的查询分解或训练计算密集型的GNN架构之外,一种并行且高效的策略是利用网络理论算法来有机地导航这些知识结构。像HippoRAG [13] 及其后继者HippoRAG2 [12] 这样的方法已证明了使用个性化PageRank来模拟人类认知索引的有效性。这使得检索信号能够自然地传播到语义节点上。
虽然TIGRAG受这些基于网络的原则启发,但它引入了一个令牌级别的提取阶段、一个动态候选池化策略以及一个迭代的、由实体驱动的多跳检索过程。特别是,它从第一个检索跳中提取命名实体以扩展查询,并应用神经重排序步骤。这使得它能够检索传统密集检索或单跳基于图的方法经常忽略的相互关联的证据。
3. 提出的方法
本节概述TIGRAG的技术特性。具体而言,第3.1小节解释了我们框架的基本原理,而后续小节则描述了构成其基础方法的各个步骤。
3.1. 动机
标准的RAG系统通常难以处理多跳推理,而基于图的检索方法常常需要承担复杂的、由LLM驱动的图构建成本。为解决这些问题,我们提出了TIGRAG,一个基于令牌共现图的轻量级图增强检索框架。TIGRAG不依赖由LLM驱动的图构建,而是直接从文本共现关系中构建令牌级别的拓扑表示,从而实现高效且可扩展的图创建。在检索过程中,它结合了基于图的语义扩展和神经重排序,以识别用于多跳推理的相互关联的证据。然后,一种迭代的、由实体驱动的检索策略,使用从先前检索到的上下文中提取的桥接实体来逐步增强查询。TIGRAG通过动态选择紧凑且高度相关的上下文,大幅减少了提示大小、推理延迟和总体计算开销,其性能优于现有的GraphRAG方法。
图1展示了TIGRAG的工作流程。如图所示,TIGRAG架构在两个基本阶段运行:(i)离线图构建,和(ii)在线推理。在离线阶段,TIGRAG将原始语料库分割成重叠的文本块,然后使用令牌共现频率来构建拓扑知识图谱。同时,TIGRAG预计算并索引块级别的密集嵌入和令牌到块的来源映射。在推理时,它对传入的查询进行令牌化以识别拓扑种子节点。这些种子节点随后驱动语义扩展过程,获取初始的候选块池。接下来,TIGRAG应用图加权评分机制来动态过滤候选块,然后将它们传递给神经重排序器进行精确的语义对齐。最终,它将筛选出的最优块注入LLM的提示中,以锚定最终生成。然后重复此单跳检索过程以实现多跳推理。

图1:TIGRAG的工作流程,展示了图构建、语义扩展和迭代多跳检索
3.2. 预处理和文本分块

3.3. 知识图谱构建

3.4. 查询预处理和语义扩展

3.5. 候选检索和图加权评分

3.6. 动态候选池化和重排序
尽管图加权评分能有效检索到一组广泛的上下文相关块,但严格依赖固定截断值可能会引入噪声。为了动态过滤候选集,我们应用了一种累积分数阈值机制。

3.7. 多跳推理和实体驱动的查询扩展


4. 实验
在本节中,我们描述为验证TIGRAG而进行的实验。具体而言,第4.1小节介绍了实验设置,第4.2小节展示了获得的结果。
4.1. 实验设置
在本节中,我们描述测试的实验设置。具体而言,我们概述了使用的数据集、考虑的基线方法、模型和提示协议、评估的指标,以及最后的超参数配置。我们在一个配备有256个AMD EPYC 7742 CPU、1 TB RAM和两个NVIDIA A100 GPU(各40 GB内存)的服务器上进行了所有实验。为确保被评估方法之间的公平比较,我们在相同的硬件基础设施上执行了所有索引、检索和生成实验。
4.1.1. 数据集
我们在三个广泛采用的多跳问答数据集上评估了TIGRAG的检索和推理能力:HotpotQA [46]、2WikiMultiHopQA [15] 和 MuSiQue [40]。为减轻计算开销同时保持统计显著性,我们按照先前研究的标准做法[13, 41, 31],从每个数据集中子采样了1,000个查询。每个数据集都提供了需要回答的问题和一个相关文档语料库。该语料库作为必须从中检索相关上下文的证据池。此外,每个查询都配有一个标准答案,以便在下游评估阶段进行严格评估。
表1提供了从每个数据集生成的图的统计信息的全面概览。
表1:每个数据集的图统计信息
| 方法 | HotpotQA | 2WikiMultiHopQA | MuSiQue |
|---|---|---|---|
| 节点数 | 55,733 | 35,251 | 56,467 |
| 边数 | 1,315,330 | 658,326 | 1,370,777 |
| 平均度 | 47.20 | 37.35 | 48.55 |
| 每个节点的平均文档数 | 8.15 | 6.99 | 8.18 |
| 块数 | 11,851 | 7,870 | 13,067 |
| 密度 | 0.0008 | 0.0011 | 0.0009 |
| 连通分量数 | 1 | 1 | 1 |
4.1.2. 基线方法
为严格评估TIGRAG的有效性,我们将其与一系列最先进的RAG方法进行了比较,涵盖了传统的密集检索技术和更先进的结构感知架构。具体而言,我们使用NaiveRAG作为标准密集检索基线,并采用RAPTOR [35]、GraphRAG [5]、LightRAG [11]、ToG [36]、KGP [42] 和 HippoRAG2 [12] 作为结合了层次化、基于图或知识引导检索机制的最新方法。我们还考虑了不使用RAG的情况。为确保公平性,我们使用了相同的生成提示,该提示旨在严格执行基于证据的推理。它如图2所示。
4.1.3. 模型和提示协议
我们实验中使用的LLM是 gemma3:27b-it-qat<sup>4</sup>。在生成阶段,我们通过图2所示的提示模板向它提供用户问题和检索到的上下文。最后,为确保公平比较,我们通过应用等效的提示策略,标准化了所有三个被评估基线的生成阶段。我们使用 Nomic Text 1.5 模型<sup>5</sup>进行密集检索和语义相似度计算。我们使用基于Treebank分词器和Punkt句子分割的NLTK进行令牌化。我们使用spacy NER流水线提取命名实体。

图2:问答生成阶段使用的提示模板。<CONTEXT_STR> 代表检索到的上下文,而 <QUESTION> 代表要回答的问题。
4.1.4. 评估指标
遵循[13]的方法,我们从三个维度评估TIGRAG:检索效能、下游生成质量和计算效率。
我们使用Recall@2 (R@2) 和 Recall@5 (R@5) 来量化检索性能,它们衡量了在前两个(R@2)或前五个(R@5)候选块中成功检索到标准支持证据的查询比例。对于生成式问答阶段,我们使用精确匹配(EM)和令牌级F1分数进行评估。EM评估严格的字符串等价性,而令牌级F1分数则评估LLM输出与标准答案在令牌级别的重叠程度。所有这些指标都在实数范围 [0,1] 内,或者如果我们以百分比表示则在 [0,100] 内;其值越高,性能越好。我们省略了KGP、ToG和RAPTOR的Recall@k指标,因为它们的结构性检索机制与块级评估不兼容。事实上,KGP和ToG检索的是知识图谱实体和关系,而RAPTOR检索的是层次化的摘要节点。因此,这三个系统无法通过Recall来可靠地评估检索质量。最后,我们省略了NoRAG的Recall@k,因为该系统没有检索机制。
除了准确性,我们还评估了RAG方法的计算负载。具体而言,我们测量了离线图构建所需的时间,以评估在大规模语料库上的可扩展性。对于在线阶段,我们报告了端到端的推理延迟,同时捕获了检索和LLM生成的时间。我们还测量了提示词元占用,即检索到的上下文的平均令牌长度。这个计算指标至关重要,因为减少上下文占用不仅降低了计算开销和延迟,还有助于缓解生成过程中注意力分散的问题。
4.1.5. 超参数配置

4.2. 结果
在本节中,我们展示实验活动的结果。具体而言,第4.2.1小节比较了TIGRAG与文献中提出的其他相关系统的性能。第4.2.2小节比较了TIGRAG和其他相关方法所需的计算资源。最后,第4.2.3小节介绍了TIGRAG的超参数和消融研究。
4.2.1. 性能比较
表2报告了所比较方法在所选多跳问答基准上的检索性能,以 R@2 和 R@5 表示。对于每一列,粗体数字表示最大值,下划线数字表示次大值。
此表显示,TIGRAG在所有评估场景中均持续优于所有基线。在HotpotQA上,与NaiveRAG相比,它在 R@2 上提高了 9.70%,在 R@5 上提高了 8.23%。这一趋势在2WikiMultiHopQA上继续,TIGRAG在 R@2 上比NaiveRAG获得了 13.41% 的提升,在 R@5 上比HippoRAG2获得了 10.76% 的提升。在更具挑战性的MuSiQue基准上,该基准需要多步语义推理,TIGRAG的提升幅度进一步增加,与HippoRAG2相比,在 R@2 上获得了 19.92% 的提升,在 R@5R@5 上获得了 9.73% 的提升。这些结果证明了令牌级拓扑扩展在增强多跳检索方面的有效性。
表2:在多跳问答基准上的检索性能(R@2 和 R@5)
| 方法 | HotpotQA | 2WikiMultiHopQA | MuSiQue | 平均值 | ||||
|---|---|---|---|---|---|---|---|---|
| R@2 | R@5 | R@2 | R@5 | R@2 | R@5 | R@2 | R@5 | |
| HippoRAG2 | 57.45% | 84.05% | 63.42% | 78.73% | 35.50% | 51.29% | 52.12% | 71.36% |
| LightRAG | 69.05% | 85.25% | 59.98% | 69.58% | 35.62% | 49.68% | 54.88% | 68.17% |
| NaiveRAG | 71.65% | 85.05% | 64.35% | 70.40% | 38.39% | 51.21% | 58.13% | 68.89% |
| TIGRAG | 78.60% | 92.05% | 72.98% | 87.20% | 42.57% | 56.28% | 64.72% | 78.51% |
随后,我们将焦点从检索指标转移到下游生成性能。表3显示了所比较方法在多跳基准上的问答性能,使用精确匹配(EM)和令牌级F1(F1)。
表3:在多跳问答基准上的问答性能(EM 和 F1)
| 方法 | HotpotQA | 2WikiMultiHopQA | MuSiQue | 平均值 | ||||
|---|---|---|---|---|---|---|---|---|
| EM | F1 | EM | F1 | EM | F1 | EM | F1 | |
| NoRAG | 28.30% | 37.93% | 30.90% | 35.20% | 7.40% | 17.59% | 22.20% | 30.24% |
| HippoRAG2 | 52.80% | 64.40% | 50.20% | 55.57% | 26.50% | 33.89% | 43.17% | 51.29% |
| Raptor | 39.80% | 55.69% | 32.40% | 38.24% | 14.40% | 24.21% | 28.87% | 39.38% |
| KGP | 22.50% | 32.26% | 11.40% | 13.08% | 11.10% | 18.15% | 15.00% | 21.16% |
| ToG | 20.60% | 26.63% | 14.50% | 17.02% | 5.80% | 8.60% | 13.63% | 17.42% |
| GraphRAG | 29.99% | 39.91% | 7.60% | 8.41% | 0.50% | 1.67% | 12.70% | 16.66% |
| LightRAG | 52.50% | 66.91% | 45.70% | 51.17% | 22.20% | 32.14% | 40.13% | 50.07% |
| NaiveRAG | 53.40% | 64.84% | 44.40% | 14.89% | 21.00% | 29.88% | 39.60% | 47.74% |
| TIGRAG | 60.70% | 72.60% | 50.90% | 58.60% | 26.20% | 35.80% | 45.93% | 55.67% |
如表3所示,TIGRAG在HotpotQA上持续提高了答案质量,与NaiveRAG相比,在EM上获得了 13.67% 的提升,在F1上获得了 11.97% 的提升。在2WikiMultiHopQA上也观察到类似趋势,TIGRAG在EM上比HippoRAG2高出 1.39%,在F1上高出 5.45%。在MuSiQue基准上,HippoRAG2获得了略高的EM值,但TIGRAG保持了更高的F1值。由于EM会严重惩罚部分正确但更详细的答案,TIGRAG更强的F1结果表明,我们的框架为多跳推理提供了更全面且语义上更可靠的证据。
4.2.2. 资源比较
RAG架构的实际可行性不仅取决于检索准确性,还取决于计算效率。在分析了第4.2.1节中的检索性能后,我们现在关注离线和在线阶段的资源消耗。为此,我们分析了三个关键维度:离线图构建时间(也称为索引时间)、在线端到端推理延迟和提示词元占用(通过检索到的上下文的长度(以令牌数计)来衡量)。这些指标评估了TIGRAG的可扩展性和实际可用性。离线索引时间衡量处理大型语料库的成本,而端到端推理延迟则捕获整个检索-生成流水线的响应能力。过大的上下文会减慢生成速度并使LLM分心;因此,减少上下文占用对于提高效率和推理质量都至关重要。表4报告了TIGRAG和相关方法在执行第4.2.1节所述测试时获得的离线索引时间和平均在线推理延迟(每个查询)。
表4:索引和检索时间;后者包括有效检索时间和LLM响应时间
| 方法 | HotpotQA | 2WikiMultiHopQA | MuSiQue | |||
|---|---|---|---|---|---|---|
| 索引 (秒) | 检索 (秒) | 索引 (秒) | 检索 (秒) | 索引 (秒) | 检索 (秒) | |
| HippoRAG2 | 308,664 | 75.60 | 121,945 | 79.48 | 318,282 | 81.67 |
| Raptor | 29,452 | 14.80 | 17,001 | 14.56 | 35,851 | 15.46 |
| KGP | 1,893 | 30.57 | 1,514 | 25.90 | 4,096 | 37.16 |
| ToG | 139,372 | 55.27 | 70,660 | 39.91 | 146,146 | 48.58 |
| GraphRAG | 657,055 | 14.91 | 74,802 | 15.75 | 195,325 | 15.75 |
| LightRAG | 721,833 | 20.31 | 343,812 | 19.96 | 593,942 | 20.46 |
| NaiveRAG | 10 | 23.35 | 6 | 63.71 | 11 | 44.45 |
| TIGRAG | 191 | 3.22 | 155 | 3.26 | 202 | 4.14 |
对此表的分析表明,NaiveRAG由于采用简单的密集检索架构,绕过了图构建,因此在离线阶段索引时间最短。尽管TIGRAG比NaiveRAG慢,但它仍然比其他基于图的方法快得多,同时实现了更强的检索和生成性能(见表2)。
在线推理阶段出现了一个引人注目的趋势。在HotpotQA上,TIGRAG比NaiveRAG稍慢。然而,在更复杂的数据集(如2WikiMultiHopQA和MuSiQue)上,TIGRAG在端到端速度上超过了NaiveRAG。这种效率提升验证了我们的假设,即通过动态提取高度集中且相关的上下文,TIGRAG可以大幅减少LLM的提示处理和生成时间。这种减少足以抵消图遍历(为PPR所需)引入的最小延迟。与最快的基于图的基线RAPTOR相比,TIGRAG大约快四倍,为图增强RAG系统设定了一个高度可扩展的标准。
表5详细列出了每个查询生成的平均上下文词元占用(以令牌数计)。
表5:每个查询的平均上下文词元占用
| 方法 | HotpotQA | 2WikiMultiHopQA | MuSiQue |
|---|---|---|---|
| GraphRAG | 1,438.47 | 1,263.10 | 1,299.82 |
| LightRAG | 4,185.54 | 3,982.53 | 4,112.78 |
| NaiveRAG | 3,465.00 | 3,197.40 | 3,870.60 |
| TIGRAG | 1,463.86 | 1,382.07 | 1,305.30 |
如表所示,严格依赖动态过滤文本块的方法产生的上下文要紧凑得多。相比之下,通过注入大量知识图谱三元组或社区摘要来增强提示的框架(如GraphRAG和LightRAG)则受困于过度膨胀的上下文窗口。TIGRAG通过依赖一个紧凑且高度相关的块池来减小提示大小,从而提高了推理速度并限制了注意力分散。
4.2.3. 超参数和消融研究
首先,我们研究检索预算如何影响LLM构建上下文的方式,特别关注提供给LLM用于上下文构建的块数 β(见第3.7节)。通过改变 ββ,我们评估了提供足够支持证据与引入语义噪声之间的权衡。因此,我们评估了上下文大小最终如何影响EM和F1分数。在表6中,我们展示了此项实验的结果。在每一列中,我们用粗体显示相应指标获得的最佳值。此表的结果突显出,性能在 β 的中间值(β=5)时达到峰值。将上下文窗口增加到超过此阈值会降低EM和F1分数。这种行为突显了LLM在暴露于过长和嘈杂上下文时容易分心。相反,将 β 设置得过低会使生成模型缺乏必要的支持证据。因此,β=5 是最佳配置,它在不使推理模型能力过载的情况下最大化信息密度。
表6:超参数 ββ 的敏感性分析
| β | HotpotQA | 2WikiMultiHopQA | MuSiQue | |||
|---|---|---|---|---|---|---|
| EM | F1 | EM | F1 | EM | F1 | |
| 3 | 57.40% | 70.02% | 45.20% | 52.41% | 23.30% | 32.68% |
| 5 | 60.70% | 72.60% | 50.90% | 58.60% | 26.20% | 35.80% |
| 10 | 55.80% | 69.21% | 44.90% | 52.66% | 22.80% | 33.09% |





消融结果突显了所提框架每个组件的重要性。移除BM25仅导致性能轻微下降,证实了基于图的扩展机制本身就能捕获高度相关的证据。用度中心性替换PPR会大幅降低所有数据集的性能,表明拓扑感知语义传播比简单的节点度数更重要。最后,消除神经重排序阶段显著降低了检索有效性,表明重排序对于过滤图扩展期间引入的噪声候选是必不可少的。
5. 讨论
从性能角度来看,TIGRAG所基于的拓扑方法增强了检索能力,并持续优于基线方法。这种高保真度的检索直接转化为更优的下游问答生成,在精确匹配和令牌级F1分数上树立了新的最先进水平。除了严格的准确性之外,TIGRAG最重要的意义在于其资源效率。通过仅通过统计共现来构建结构图,TIGRAG消除了传统GraphRAG方法所需的计算成本高昂的、由LLM驱动的实体提取流水线。因此,它在离线图构建和在线推理期间消耗的时间和词元预算都大大减少,为现实世界的部署提供了一个高度可扩展的解决方案。
尽管结果令人鼓舞,但TIGRAG有一些局限性,这些局限性为未来的研究指出了有趣的方向。首先,TIGRAG的迭代式、由实体驱动的检索策略严重依赖于命名实体识别(NER)流水线的质量。由于查询扩展是由从先前检索到的块中提取的实体引导的,不准确、模糊或不相关的实体可能会在检索阶段传播,导致语义漂移和检索精度降低。因此,探索更鲁棒的实体消歧和过滤机制是未来工作的重要方向。其次,与其他基于共现的方法一样,TIGRAG主要捕获从令牌邻近性中涌现的关系。未来的工作将研究轻量级的语义丰富策略,这些策略可以更好地建模隐含连接,同时保持TIGRAG的计算效率。
6. 结论
在这项工作中,我们提出了TIGRAG,一个由令牌共现知识图谱驱动的有效且高效的RAG框架。与依赖于昂贵的基于LLM的实体和关系提取流水线的传统GraphRAG方法不同,TIGRAG直接从令牌共现中构建了一个轻量级的拓扑表示。它还使用基于PPR的语义扩展和动态神经重排序来跨多个跳检索相互关联的证据。通过绕过计算成本高昂的、基于LLM的图构建索引,TIGRAG所基于的令牌级方法实现了更快的离线图构建,同时保留了多跳推理所需的结构依赖性。在HotpotQA、2WikiMultiHopQA和MuSiQue上的实证评估表明,TIGRAG显著提高了检索性能,与基线模型相比建立了新的最先进性能。这些发现证明,图增强RAG系统可以在不牺牲计算效率的情况下解决复杂的多跳推理任务。
我们目前的评估侧重于文本多跳数据集;然而,这项研究为未来的研究指出了几个有前景的方向。首先,我们计划通过引入语义边来扩展图拓扑,使其超越统计共现。这种语义平滑将连接词汇不同但语义相似的令牌,从而捕获隐含关系。其次,我们计划通过引入语义感知节点来解决令牌多义性的固有限制,从而处理仅将令牌视为词汇单元的局限。这将使图能够动态消歧含义,实现更细粒度和更精确的检索。最后,由于现代信息生态系统本质上是异质的,未来的一个发展方向是将TIGRAG扩展到多模态设置。这将涉及将图像和视频整合到拓扑空间中,以支持更复杂的问答任务。
5845

被折叠的 条评论
为什么被折叠?



