GraphRAG四大搜索策略学习

GraphRAG 提供了四种不同的搜索策略,按照复杂程度递增的顺序,它们分别是:基础搜索(Basic Search)、本地搜索(Local Search)、全局搜索(Global Search)和漂移搜索(DRIFT Search)。

1. 基础搜索(Basic Search)

基础搜索本质就是传统向量 RAG,是四种策略里最简单的检索方案,流程只有三步:

  1. 查询向量化:将用户输入问题做 Embedding,转换成向量表征。
  2. 向量库相似检索:在存储文本片段(text chunk)的向量数据库中,做相似度匹配,召回 Top-K 最相近的原始文本块。
  3. LLM 生成答案:把召回的文本片段作为上下文,拼接用户原始提问一起送入大模型,由 LLM 直接输出回答。

核心特点与局限

  • 适用场景:简单事实类问题,答案集中在少量文档片段内(定义、基础参数、单一实体基础信息);
  • 短板:只依靠向量语义匹配,没有知识图谱实体、关系、社区信息,无法做多实体关联推理、全局汇总类复杂问题。

2. 本地搜索(Local Search)

本地搜索依托知识图谱实体、关系、社区结构做多源上下文扩展,整体分为四大阶段:实体识别 → 上下文扩展 → 排序过滤 → 答案生成。

1. 实体识别阶段

  1. 对用户查询向量化;
  2. 实体描述向量库做相似度检索,匹配出查询语义相关的候选实体集合。

2. 多维度上下文扩展阶段

基于上一步得到的实体,从四类数据源拉取关联信息:

  1. 文本单元扩展:通过实体-文本映射表,取出包含该实体的原始文档片段;
  2. 社区报告扩展:根据实体归属社区,调取对应社区主题摘要;
  3. 实体关系扩展:以实体为图谱节点,查找相连实体与关系,构建关系上下文;
  4. 协变量扩展(可选):若开启协变量提取,补充实体相关声明、属性信息。

3. 排序和 Token 过滤阶段

  1. 重要性排序
    • 文本单元:关联实体/关系数量越多,优先级越高;
    • 社区报告:包含检索实体越多,权重越高;
  2. Token 过滤:按照 LLM 输入 Token 上限截断,剔除低权重内容,控制上下文长度。

4. 答案生成阶段

将过滤后的文本块、实体关系、社区摘要整合为结构化上下文,搭配专属提示词送入大模型,输出融合实体关联信息的回答。

核心适用场景

需要实体关联推理的问题:实体属性查询、多实体关系对比、领域相关实体汇总;弥补基础搜索无法跨片段关联实体的缺陷。

3. 全局搜索的流程

全局搜索采用 Map-Reduce 双阶段架构,专门处理数据集宏观、汇总类问题,全程不依赖细粒度文本块,只使用浓缩的社区报告。

1. Map 并行处理阶段(批量生成局部观点)

  1. 社区报告筛选收集
    • 读取指定层级的所有社区报告;
    • 动态筛选:大模型根据用户查询给社区报告打分,只保留高于阈值的高相关社区。
  2. 批次拆分:按照 LLM Token 上限,把社区报告随机切分成多个独立批次。
  3. 并行分析生成中间观点:每一批社区报告 + 用户问题送入大模型,输出多条带 1-100 重要性评分的中间观点,仅做归纳,不直接回答原问题。

2. Reduce 聚合阶段(汇总所有观点生成最终答案)

  1. 全局排序:收集所有批次产出的观点,按重要性分数从高到低排序。
  2. 智能过滤截断:在 Token 预算内保留高分核心观点,舍弃低价值内容。
  3. 统一聚合输出:将筛选后的全部观点作为上下文,送入大模型,生成完整、宏观的总结答案。

关键特点与适用场景

  • 适用场景:数据集主题归纳、整体趋势分析、全局关键人物/实体汇总等宏观类提问。
  • 底层逻辑:依靠图谱分层社区摘要,避免遍历海量原始文本,实现全局视角检索。

4. 漂移搜索(DRIFT Search)

DRIFT 全称:Dynamic Reasoning and Inference with Flexible Traversal,融合全局搜索广度 + 本地搜索深度,分为三大阶段:Primer 全局初筛 → Follow-Up 迭代深挖 → Reduce 综合汇总。

1. Primer 全局初步认知(宏观打底)

  1. 基于 HyDE 筛选社区报告:根据用户原始查询生成一份模拟社区报告结构的假设文档,用该假设文档做向量匹配,选出 Top-K 最相关社区报告;相比直接使用用户 Query 嵌入,召回精度更高。
  2. 批量生成初步答案与待探索子问题:将筛选出的社区报告按 Token 限制拆分为多批次,每批结合用户问题送入大模型,输出两部分内容:
    • 对原问题的宏观初步回答;
    • 识别信息缺口,生成一批需要深入查证的细分后续问题。

2. Follow-Up 循环局部深挖(while 循环迭代)

  1. 筛选高分的子问题:从 Primer 产出的后续问题里选取评分最高 Top-K 个问题;
  2. 调用本地搜索逐一求解:对每个子问题执行完整 Local Search 流程,获取实体、关系、原文片段等细节中间答案;
  3. 迭代生成新一轮细分问题:基于本次本地搜索结果继续挖掘更深层待验证问题,进入下一轮循环。

3. Reduce 整合输出综合答案

收集 Primer 全局宏观结论 + 所有轮次本地细节结果,统一汇总,送入大模型,生成兼顾整体概况与实体细节、逻辑连贯的完整回答。

关键特点与适用场景

  1. 核心逻辑:先宏观把握整体方向,再逐层下钻实体细节,模拟分析师调研思路;
  2. 适用场景:复杂探索类问题、领域趋势分析、多实体关联因果分析、复杂事件完整复盘;
  3. 对比优势:无需人工区分该用全局还是本地搜索,自动兼顾广度与深度。

借用一张对比图:

参考:

【值得收藏】一文吃透GraphRAG四大搜索策略,提升大模型应用能力-CSDN博客

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

l8947943

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值