GraphRAG 提供了四种不同的搜索策略,按照复杂程度递增的顺序,它们分别是:基础搜索(Basic Search)、本地搜索(Local Search)、全局搜索(Global Search)和漂移搜索(DRIFT Search)。
1. 基础搜索(Basic Search)
基础搜索本质就是传统向量 RAG,是四种策略里最简单的检索方案,流程只有三步:
- 查询向量化:将用户输入问题做 Embedding,转换成向量表征。
- 向量库相似检索:在存储文本片段(text chunk)的向量数据库中,做相似度匹配,召回 Top-K 最相近的原始文本块。
- LLM 生成答案:把召回的文本片段作为上下文,拼接用户原始提问一起送入大模型,由 LLM 直接输出回答。
核心特点与局限
- 适用场景:简单事实类问题,答案集中在少量文档片段内(定义、基础参数、单一实体基础信息);
- 短板:只依靠向量语义匹配,没有知识图谱实体、关系、社区信息,无法做多实体关联推理、全局汇总类复杂问题。
2. 本地搜索(Local Search)
本地搜索依托知识图谱实体、关系、社区结构做多源上下文扩展,整体分为四大阶段:实体识别 → 上下文扩展 → 排序过滤 → 答案生成。
1. 实体识别阶段
- 对用户查询向量化;
- 在实体描述向量库做相似度检索,匹配出查询语义相关的候选实体集合。
2. 多维度上下文扩展阶段
基于上一步得到的实体,从四类数据源拉取关联信息:
- 文本单元扩展:通过实体-文本映射表,取出包含该实体的原始文档片段;
- 社区报告扩展:根据实体归属社区,调取对应社区主题摘要;
- 实体关系扩展:以实体为图谱节点,查找相连实体与关系,构建关系上下文;
- 协变量扩展(可选):若开启协变量提取,补充实体相关声明、属性信息。
3. 排序和 Token 过滤阶段
- 重要性排序
- 文本单元:关联实体/关系数量越多,优先级越高;
- 社区报告:包含检索实体越多,权重越高;
- Token 过滤:按照 LLM 输入 Token 上限截断,剔除低权重内容,控制上下文长度。
4. 答案生成阶段
将过滤后的文本块、实体关系、社区摘要整合为结构化上下文,搭配专属提示词送入大模型,输出融合实体关联信息的回答。
核心适用场景
需要实体关联推理的问题:实体属性查询、多实体关系对比、领域相关实体汇总;弥补基础搜索无法跨片段关联实体的缺陷。
3. 全局搜索的流程
全局搜索采用 Map-Reduce 双阶段架构,专门处理数据集宏观、汇总类问题,全程不依赖细粒度文本块,只使用浓缩的社区报告。
1. Map 并行处理阶段(批量生成局部观点)
- 社区报告筛选收集
- 读取指定层级的所有社区报告;
- 动态筛选:大模型根据用户查询给社区报告打分,只保留高于阈值的高相关社区。
- 批次拆分:按照 LLM Token 上限,把社区报告随机切分成多个独立批次。
- 并行分析生成中间观点:每一批社区报告 + 用户问题送入大模型,输出多条带 1-100 重要性评分的中间观点,仅做归纳,不直接回答原问题。
2. Reduce 聚合阶段(汇总所有观点生成最终答案)
- 全局排序:收集所有批次产出的观点,按重要性分数从高到低排序。
- 智能过滤截断:在 Token 预算内保留高分核心观点,舍弃低价值内容。
- 统一聚合输出:将筛选后的全部观点作为上下文,送入大模型,生成完整、宏观的总结答案。
关键特点与适用场景
- 适用场景:数据集主题归纳、整体趋势分析、全局关键人物/实体汇总等宏观类提问。
- 底层逻辑:依靠图谱分层社区摘要,避免遍历海量原始文本,实现全局视角检索。
4. 漂移搜索(DRIFT Search)
DRIFT 全称:Dynamic Reasoning and Inference with Flexible Traversal,融合全局搜索广度 + 本地搜索深度,分为三大阶段:Primer 全局初筛 → Follow-Up 迭代深挖 → Reduce 综合汇总。
1. Primer 全局初步认知(宏观打底)
- 基于 HyDE 筛选社区报告:根据用户原始查询生成一份模拟社区报告结构的假设文档,用该假设文档做向量匹配,选出 Top-K 最相关社区报告;相比直接使用用户 Query 嵌入,召回精度更高。
- 批量生成初步答案与待探索子问题:将筛选出的社区报告按 Token 限制拆分为多批次,每批结合用户问题送入大模型,输出两部分内容:
- 对原问题的宏观初步回答;
- 识别信息缺口,生成一批需要深入查证的细分后续问题。
2. Follow-Up 循环局部深挖(while 循环迭代)
- 筛选高分的子问题:从 Primer 产出的后续问题里选取评分最高 Top-K 个问题;
- 调用本地搜索逐一求解:对每个子问题执行完整 Local Search 流程,获取实体、关系、原文片段等细节中间答案;
- 迭代生成新一轮细分问题:基于本次本地搜索结果继续挖掘更深层待验证问题,进入下一轮循环。
3. Reduce 整合输出综合答案
收集 Primer 全局宏观结论 + 所有轮次本地细节结果,统一汇总,送入大模型,生成兼顾整体概况与实体细节、逻辑连贯的完整回答。
关键特点与适用场景
- 核心逻辑:先宏观把握整体方向,再逐层下钻实体细节,模拟分析师调研思路;
- 适用场景:复杂探索类问题、领域趋势分析、多实体关联因果分析、复杂事件完整复盘;
- 对比优势:无需人工区分该用全局还是本地搜索,自动兼顾广度与深度。
借用一张对比图:
参考:

596

被折叠的 条评论
为什么被折叠?



