RAG 评测指标按照「检索层-生成层-端到端层-工程层-专项安全层」五层架构拆解,覆盖从底层组件能力到最终业务价值的全链路;按评测方式可分为客观量化指标、LLM 语义评测指标和人工评审指标三类。以下是各维度的具体指标、计算逻辑、核心价值与生产环境参考基准。
一、检索质量核心指标(基础层)
检索是 RAG 的效果上限,核心衡量「找得全不全、排得好不好、准不准」,以客观可量化计算为主,是问题定位的首要维度。
| 指标名称 | 英文全称 | 定义与计算方式 | 核心价值 | 生产环境参考阈值 |
|---|---|---|---|---|
| 命中率 | Hit Rate@k | 在前 k 个检索结果中,至少包含 1 个与问题相关的有效片段的任务占总任务的比例。 公式:命中相关片段的任务数 / 总任务数 | 衡量检索的基础兜底能力,判断最相关内容是否能进入返回列表 | Hit Rate@3 ≥ 90% Hit Rate@5 ≥ 95% |
| 上下文召回率 | Context Recall | 标准答案中的所有信息点,有多少比例能被检索到的上下文片段覆盖。 公式:可被检索上下文支撑的答案信息点数量 / 标准答案总信息点数量 | 面向最终答案视角的召回质量,直接决定生成内容的信息完整性上限 | ≥ 0.85 |
| 召回率 | Recall@k | 所有标注为相关的文档片段中,有多少比例出现在前 k 个检索结果里。 公式:Top-k 中相关片段数 / 全部相关片段总数 | 传统检索领域通用指标,衡量全量相关内容的召回能力 | Recall@10 ≥ 0.90 |
| 平均倒数排名 | MRR (Mean Reciprocal Rank) | 第一个相关片段出现位置的倒数的平均值,排名越靠前分数越高。 公式:所有任务的 (1/第一个相关片段位置) 取平均 | 衡量排序质量,核心关注「最相关的结果能不能排到最前面」 | ≥ 0.75 |
| 归一化折损累计增益 | NDCG@k | 综合考虑结果的相关程度分级(完全相关/部分相关/不相关)与排序位置,排序越准确、高相关结果越靠前,分数越高。 | 分级评估排序质量,比 MRR 更贴合多粒度相关度的业务场景 | NDCG@5 ≥ 0.80 |
| 平均精度均值 | MAP@k | 每个任务的 Precision@k 取平均,同时衡量召回数量与排序位置。 | 适合相关片段较多的场景,综合评估整体排序精度 | MAP@5 ≥ 0.78 |
| 上下文精准率 | Context Precision | 检索返回的所有片段中,真正对回答问题有帮助的相关片段占比。 公式:相关片段数 / 总返回片段数 | 控制检索噪声,避免无关片段进入生成环节引发幻觉、推高成本 | ≥ 0.80 |
| 检索噪声占比 | Noise Rate | 检索结果中与问题完全无关的片段比例,是精准率的反向指标。 公式:无关片段数 / 总返回片段数 | 直接反映检索的干净程度,噪声过高会显著增加生成幻觉风险 | ≤ 10% |
二、生成质量核心指标(核心层)
在检索结果正确的前提下,衡量大模型对知识的利用能力,核心围绕「不编造、不跑题、说清楚」,以 LLM-as-Judge 语义评测与人工评审为主。
1. 事实一致性类(红线指标)
| 指标名称 | 英文全称 | 定义与计算方式 | 核心价值 | 生产环境参考阈值 |
|---|---|---|---|---|
| 忠实度 | Faithfulness | 生成答案中的每一条事实性陈述,是否都能被检索上下文直接支撑,无凭空捏造、无上下文矛盾。 公式:可被上下文验证的事实断言数 / 答案总事实断言数 | RAG 最核心的指标,直接衡量幻觉控制能力,是事实准确性的底线 | ≥ 0.90(强监管场景≥0.95) |
| 幻觉率 | Hallucination Rate | 生成内容中存在无依据编造、与上下文矛盾的内容的任务占比,或事实点的错误比例。 公式:1 - 忠实度 | 忠实度的反向指标,直观反映幻觉严重程度 | ≤ 10% |
| 引用准确率 | Citation Accuracy | 若开启来源引用功能,答案中标注的引用来源与对应内容真实匹配的比例。 | 保障可追溯性,满足合规审计要求,同时辅助定位幻觉来源 | ≥ 90% |
2. 问答质量类
| 指标名称 | 英文全称 | 定义与计算方式 | 核心价值 | 生产环境参考阈值 |
|---|---|---|---|---|
| 答案相关性 | Answer Relevancy | 生成答案是否直接回应用户问题,无答非所问、无关发散、避重就轻。 | 衡量回答的切题程度,避免“正确但没用”的答案 | ≥ 0.85 |
| 答案完整度 | Answer Completeness | 生成答案是否完整覆盖问题所需的全部信息要点,无关键信息遗漏。 | 衡量回答的信息充分性,直接影响问题解决效果 | ≥ 0.80 |
| 拒答准确率 | Abstention Accuracy | 对于知识库无覆盖、无法回答的超纲问题,模型能够正确拒答而非编造答案的比例。 | 防控超纲场景的幻觉风险,是线上幻觉的高发治理点 | ≥ 95% |
| 逻辑一致性 | Logical Consistency | 答案内部前后表述无矛盾、推理链条连贯、因果关系成立的比例。 | 避免多片段拼接导致的逻辑冲突、前后矛盾 | ≥ 0.90 |
3. 表达质量类
- 语言流畅度:表述通顺、无语法错误、无生硬拼接,人工评分 1-5 分,参考基准 ≥ 4.2/5
- 信息整合度:多来源信息融合自然,而非生硬罗列、重复堆砌,人工评分 1-5 分,参考基准 ≥ 4/5
- 风格符合度:回答语气、格式、专业度符合业务场景要求(如客服话术、正式公文),人工评分 1-5 分
三、端到端整体效果指标(业务视角)
站在最终用户与业务视角,不拆解中间过程,直接评估完整问答链路的交付价值。
| 指标名称 | 定义与计算方式 | 核心价值 | 生产环境参考阈值 |
|---|---|---|---|
| 端到端问答准确率 | 答案事实准确、完整回应用户问题、无幻觉的任务占总任务的比例。 | 最直观的整体效果指标,反映 RAG 系统的综合能力 | ≥ 85% |
| 问题解决率 | 用户问题通过 RAG 回答后无需进一步追问、无需人工介入的比例。 | 直接对齐业务价值,衡量 RAG 替代人工的能力 | 客服场景≥80% 内部知识库≥75% |
| 答案采纳率 | 用户对回答点击采纳、认可、无负反馈的比例。 | 线上真实用户的效果反馈,比实验室评测更贴近实际 | ≥ 80% |
| 用户满意度 | 用户对回答的主观评分(1-5分)。 | 综合反映回答的准确性、实用性、易用性 | ≥ 4.0/5 |
| 负反馈率 | 用户点踩、投诉、要求转人工的任务占比。 | 反向核心指标,快速定位线上效果劣化 | ≤ 5% |
四、系统工程与成本指标(生产落地层)
面向生产环境的性能、成本与稳定性指标,直接决定上线可行性与运维成本。
1. 性能与时延
- 检索时延:向量检索+粗排的耗时,参考基准 ≤ 100ms
- 首 Token 时延:从请求发出到生成第一个字的耗时,参考基准 ≤ 1s
- 端到端总时延:从用户提问到回答完全生成的总耗时,参考基准 ≤ 3s
- 吞吐量(QPS):单实例每秒可处理的请求数,参考基准 ≥ 50,支持水平扩展
2. 成本与资源
- 单请求 Token 消耗:单次问答的上下文+输出总 Token 数,直接决定大模型调用成本
- 单请求平均成本:Token 费用 + 向量检索 + 重排等组件费用总和,按业务预算设定阈值
- 向量索引内存占用:知识库对应的向量索引存储空间,影响部署成本
- 缓存命中率:高频问题的缓存命中比例,是成本优化的核心抓手
3. 稳定性
- 服务可用性:接口正常服务的时间占比,参考基准 ≥ 99.9%
- 超时率:请求超时的比例,参考基准 ≤ 0.1%
- 错误率:请求返回系统异常的比例,参考基准 ≤ 0.05%
五、专项能力与鲁棒性指标
针对特定 RAG 形态与复杂场景的专项评测指标。
1. 多轮对话 RAG 专项
- 多轮意图保持率:多轮对话中,Query 改写后不偏离用户原始意图的比例,参考基准 ≥ 98%
- 上下文记忆准确率:跨轮次关键信息(如用户前置条件、偏好)被正确复用的比例,参考基准 ≥ 95%
- 话题切换准确率:用户切换话题时,检索与生成能正确切换知识领域的比例
2. 多跳问答专项
- 多跳召回率:需要跨多个文档、多步推理的问题,所有必要信息片段均被召回的比例
- 推理链条完整度:多步推理逻辑完整、无跳跃、无断层的比例
3. 鲁棒性专项
- 口语化输入衰减率:口语化、非标准化提问相比标准提问的准确率下降幅度,参考基准 ≤ 10%
- 错别字容错率:存在少量错别字的提问,检索与生成效果的保持率,参考基准 ≥ 90%
- 长 Query 适配性:长文本、多条件提问下的效果衰减率,参考基准 ≤ 15%
4. 知识库适配专项
- 新增知识适配率:新增知识库内容后,对应问题的召回率与准确率提升幅度
- 知识更新准确率:知识库内容更新后,回答同步更新、不输出旧信息的比例
- 跨领域效果衰减率:在未优化的新领域知识上的准确率下降幅度
六、安全与合规指标
金融、医疗、政务、法律等强监管场景的必选指标。
- 敏感信息泄露率:回答中泄露涉密内容、用户隐私、内部数据的任务占比,需趋近于 0
- 合规违规率:输出内容违反行业监管规定(如违规荐股、非法诊疗建议)的比例,需趋近于 0
- Prompt 注入绕过率:通过注入攻击诱导模型绕过限制、输出违规内容的成功率,需趋近于 0
- 有害内容输出率:输出暴力、歧视、低俗等有害内容的比例,需趋近于 0
不同业务场景的指标优先级差异显著:法律/金融场景以忠实度、引用准确率、合规违规率为核心;智能客服场景以问题解决率、拒答准确率、端到端时延为核心;
企业内部知识库以上下文召回率、答案完整度为核心。

1602

被折叠的 条评论
为什么被折叠?



