RAG 评测指标

RAG 评测指标按照「检索层-生成层-端到端层-工程层-专项安全层」五层架构拆解,覆盖从底层组件能力到最终业务价值的全链路;按评测方式可分为客观量化指标LLM 语义评测指标人工评审指标三类。以下是各维度的具体指标、计算逻辑、核心价值与生产环境参考基准。

一、检索质量核心指标(基础层)

检索是 RAG 的效果上限,核心衡量「找得全不全、排得好不好、准不准」,以客观可量化计算为主,是问题定位的首要维度。

指标名称英文全称定义与计算方式核心价值生产环境参考阈值
命中率Hit Rate@k在前 k 个检索结果中,至少包含 1 个与问题相关的有效片段的任务占总任务的比例。
公式:命中相关片段的任务数 / 总任务数
衡量检索的基础兜底能力,判断最相关内容是否能进入返回列表Hit Rate@3 ≥ 90%
Hit Rate@5 ≥ 95%
上下文召回率Context Recall标准答案中的所有信息点,有多少比例能被检索到的上下文片段覆盖。
公式:可被检索上下文支撑的答案信息点数量 / 标准答案总信息点数量
面向最终答案视角的召回质量,直接决定生成内容的信息完整性上限≥ 0.85
召回率Recall@k所有标注为相关的文档片段中,有多少比例出现在前 k 个检索结果里。
公式:Top-k 中相关片段数 / 全部相关片段总数
传统检索领域通用指标,衡量全量相关内容的召回能力Recall@10 ≥ 0.90
平均倒数排名MRR (Mean Reciprocal Rank)第一个相关片段出现位置的倒数的平均值,排名越靠前分数越高。
公式:所有任务的 (1/第一个相关片段位置) 取平均
衡量排序质量,核心关注「最相关的结果能不能排到最前面」≥ 0.75
归一化折损累计增益NDCG@k综合考虑结果的相关程度分级(完全相关/部分相关/不相关)与排序位置,排序越准确、高相关结果越靠前,分数越高。分级评估排序质量,比 MRR 更贴合多粒度相关度的业务场景NDCG@5 ≥ 0.80
平均精度均值MAP@k每个任务的 Precision@k 取平均,同时衡量召回数量与排序位置。适合相关片段较多的场景,综合评估整体排序精度MAP@5 ≥ 0.78
上下文精准率Context Precision检索返回的所有片段中,真正对回答问题有帮助的相关片段占比。
公式:相关片段数 / 总返回片段数
控制检索噪声,避免无关片段进入生成环节引发幻觉、推高成本≥ 0.80
检索噪声占比Noise Rate检索结果中与问题完全无关的片段比例,是精准率的反向指标。
公式:无关片段数 / 总返回片段数
直接反映检索的干净程度,噪声过高会显著增加生成幻觉风险≤ 10%

二、生成质量核心指标(核心层)

在检索结果正确的前提下,衡量大模型对知识的利用能力,核心围绕「不编造、不跑题、说清楚」,以 LLM-as-Judge 语义评测与人工评审为主。

1. 事实一致性类(红线指标)

指标名称英文全称定义与计算方式核心价值生产环境参考阈值
忠实度Faithfulness生成答案中的每一条事实性陈述,是否都能被检索上下文直接支撑,无凭空捏造、无上下文矛盾。
公式:可被上下文验证的事实断言数 / 答案总事实断言数
RAG 最核心的指标,直接衡量幻觉控制能力,是事实准确性的底线≥ 0.90(强监管场景≥0.95)
幻觉率Hallucination Rate生成内容中存在无依据编造、与上下文矛盾的内容的任务占比,或事实点的错误比例。
公式:1 - 忠实度
忠实度的反向指标,直观反映幻觉严重程度≤ 10%
引用准确率Citation Accuracy若开启来源引用功能,答案中标注的引用来源与对应内容真实匹配的比例。保障可追溯性,满足合规审计要求,同时辅助定位幻觉来源≥ 90%

2. 问答质量类

指标名称英文全称定义与计算方式核心价值生产环境参考阈值
答案相关性Answer Relevancy生成答案是否直接回应用户问题,无答非所问、无关发散、避重就轻。衡量回答的切题程度,避免“正确但没用”的答案≥ 0.85
答案完整度Answer Completeness生成答案是否完整覆盖问题所需的全部信息要点,无关键信息遗漏。衡量回答的信息充分性,直接影响问题解决效果≥ 0.80
拒答准确率Abstention Accuracy对于知识库无覆盖、无法回答的超纲问题,模型能够正确拒答而非编造答案的比例。防控超纲场景的幻觉风险,是线上幻觉的高发治理点≥ 95%
逻辑一致性Logical Consistency答案内部前后表述无矛盾、推理链条连贯、因果关系成立的比例。避免多片段拼接导致的逻辑冲突、前后矛盾≥ 0.90

3. 表达质量类

  • 语言流畅度:表述通顺、无语法错误、无生硬拼接,人工评分 1-5 分,参考基准 ≥ 4.2/5
  • 信息整合度:多来源信息融合自然,而非生硬罗列、重复堆砌,人工评分 1-5 分,参考基准 ≥ 4/5
  • 风格符合度:回答语气、格式、专业度符合业务场景要求(如客服话术、正式公文),人工评分 1-5 分

三、端到端整体效果指标(业务视角)

站在最终用户与业务视角,不拆解中间过程,直接评估完整问答链路的交付价值。

指标名称定义与计算方式核心价值生产环境参考阈值
端到端问答准确率答案事实准确、完整回应用户问题、无幻觉的任务占总任务的比例。最直观的整体效果指标,反映 RAG 系统的综合能力≥ 85%
问题解决率用户问题通过 RAG 回答后无需进一步追问、无需人工介入的比例。直接对齐业务价值,衡量 RAG 替代人工的能力客服场景≥80%
内部知识库≥75%
答案采纳率用户对回答点击采纳、认可、无负反馈的比例。线上真实用户的效果反馈,比实验室评测更贴近实际≥ 80%
用户满意度用户对回答的主观评分(1-5分)。综合反映回答的准确性、实用性、易用性≥ 4.0/5
负反馈率用户点踩、投诉、要求转人工的任务占比。反向核心指标,快速定位线上效果劣化≤ 5%

四、系统工程与成本指标(生产落地层)

面向生产环境的性能、成本与稳定性指标,直接决定上线可行性与运维成本。

1. 性能与时延

  • 检索时延:向量检索+粗排的耗时,参考基准 ≤ 100ms
  • 首 Token 时延:从请求发出到生成第一个字的耗时,参考基准 ≤ 1s
  • 端到端总时延:从用户提问到回答完全生成的总耗时,参考基准 ≤ 3s
  • 吞吐量(QPS):单实例每秒可处理的请求数,参考基准 ≥ 50,支持水平扩展

2. 成本与资源

  • 单请求 Token 消耗:单次问答的上下文+输出总 Token 数,直接决定大模型调用成本
  • 单请求平均成本:Token 费用 + 向量检索 + 重排等组件费用总和,按业务预算设定阈值
  • 向量索引内存占用:知识库对应的向量索引存储空间,影响部署成本
  • 缓存命中率:高频问题的缓存命中比例,是成本优化的核心抓手

3. 稳定性

  • 服务可用性:接口正常服务的时间占比,参考基准 ≥ 99.9%
  • 超时率:请求超时的比例,参考基准 ≤ 0.1%
  • 错误率:请求返回系统异常的比例,参考基准 ≤ 0.05%

五、专项能力与鲁棒性指标

针对特定 RAG 形态与复杂场景的专项评测指标。

1. 多轮对话 RAG 专项

  • 多轮意图保持率:多轮对话中,Query 改写后不偏离用户原始意图的比例,参考基准 ≥ 98%
  • 上下文记忆准确率:跨轮次关键信息(如用户前置条件、偏好)被正确复用的比例,参考基准 ≥ 95%
  • 话题切换准确率:用户切换话题时,检索与生成能正确切换知识领域的比例

2. 多跳问答专项

  • 多跳召回率:需要跨多个文档、多步推理的问题,所有必要信息片段均被召回的比例
  • 推理链条完整度:多步推理逻辑完整、无跳跃、无断层的比例

3. 鲁棒性专项

  • 口语化输入衰减率:口语化、非标准化提问相比标准提问的准确率下降幅度,参考基准 ≤ 10%
  • 错别字容错率:存在少量错别字的提问,检索与生成效果的保持率,参考基准 ≥ 90%
  • 长 Query 适配性:长文本、多条件提问下的效果衰减率,参考基准 ≤ 15%

4. 知识库适配专项

  • 新增知识适配率:新增知识库内容后,对应问题的召回率与准确率提升幅度
  • 知识更新准确率:知识库内容更新后,回答同步更新、不输出旧信息的比例
  • 跨领域效果衰减率:在未优化的新领域知识上的准确率下降幅度

六、安全与合规指标

金融、医疗、政务、法律等强监管场景的必选指标。

  • 敏感信息泄露率:回答中泄露涉密内容、用户隐私、内部数据的任务占比,需趋近于 0
  • 合规违规率:输出内容违反行业监管规定(如违规荐股、非法诊疗建议)的比例,需趋近于 0
  • Prompt 注入绕过率:通过注入攻击诱导模型绕过限制、输出违规内容的成功率,需趋近于 0
  • 有害内容输出率:输出暴力、歧视、低俗等有害内容的比例,需趋近于 0

不同业务场景的指标优先级差异显著:法律/金融场景以忠实度、引用准确率、合规违规率为核心;智能客服场景以问题解决率、拒答准确率、端到端时延为核心;
企业内部知识库以上下文召回率、答案完整度为核心。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值