ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

RAG 评测指标

RAG 评测指标 RAG 评测指标按照「检索层-生成层-端到端层-工程层-专项安全层」五层架构拆解覆盖从底层组件能力到最终业务价值的全链路按评测方式可分为客观量化指标、LLM 语义评测指标和人工评审指标三类。以下是各维度的具体指标、计算逻辑、核心价值与生产环境参考基准。一、检索质量核心指标基础层检索是 RAG 的效果上限核心衡量「找得全不全、排得好不好、准不准」以客观可量化计算为主是问题定位的首要维度。指标名称英文全称定义与计算方式核心价值生产环境参考阈值命中率Hit Ratek在前 k 个检索结果中至少包含 1 个与问题相关的有效片段的任务占总任务的比例。公式命中相关片段的任务数 / 总任务数衡量检索的基础兜底能力判断最相关内容是否能进入返回列表Hit Rate3 ≥ 90%Hit Rate5 ≥ 95%上下文召回率Context Recall标准答案中的所有信息点有多少比例能被检索到的上下文片段覆盖。公式可被检索上下文支撑的答案信息点数量 / 标准答案总信息点数量面向最终答案视角的召回质量直接决定生成内容的信息完整性上限≥ 0.85召回率Recallk所有标注为相关的文档片段中有多少比例出现在前 k 个检索结果里。公式Top-k 中相关片段数 / 全部相关片段总数传统检索领域通用指标衡量全量相关内容的召回能力Recall10 ≥ 0.90平均倒数排名MRR (Mean Reciprocal Rank)第一个相关片段出现位置的倒数的平均值排名越靠前分数越高。公式所有任务的 (1/第一个相关片段位置) 取平均衡量排序质量核心关注「最相关的结果能不能排到最前面」≥ 0.75归一化折损累计增益NDCGk综合考虑结果的相关程度分级完全相关/部分相关/不相关与排序位置排序越准确、高相关结果越靠前分数越高。分级评估排序质量比 MRR 更贴合多粒度相关度的业务场景NDCG5 ≥ 0.80平均精度均值MAPk每个任务的 Precisionk 取平均同时衡量召回数量与排序位置。适合相关片段较多的场景综合评估整体排序精度MAP5 ≥ 0.78上下文精准率Context Precision检索返回的所有片段中真正对回答问题有帮助的相关片段占比。公式相关片段数 / 总返回片段数控制检索噪声避免无关片段进入生成环节引发幻觉、推高成本≥ 0.80检索噪声占比Noise Rate检索结果中与问题完全无关的片段比例是精准率的反向指标。公式无关片段数 / 总返回片段数直接反映检索的干净程度噪声过高会显著增加生成幻觉风险≤ 10%二、生成质量核心指标核心层在检索结果正确的前提下衡量大模型对知识的利用能力核心围绕「不编造、不跑题、说清楚」以 LLM-as-Judge 语义评测与人工评审为主。1. 事实一致性类红线指标指标名称英文全称定义与计算方式核心价值生产环境参考阈值忠实度Faithfulness生成答案中的每一条事实性陈述是否都能被检索上下文直接支撑无凭空捏造、无上下文矛盾。公式可被上下文验证的事实断言数 / 答案总事实断言数RAG 最核心的指标直接衡量幻觉控制能力是事实准确性的底线≥ 0.90强监管场景≥0.95幻觉率Hallucination Rate生成内容中存在无依据编造、与上下文矛盾的内容的任务占比或事实点的错误比例。公式1 - 忠实度忠实度的反向指标直观反映幻觉严重程度≤ 10%引用准确率Citation Accuracy若开启来源引用功能答案中标注的引用来源与对应内容真实匹配的比例。保障可追溯性满足合规审计要求同时辅助定位幻觉来源≥ 90%2. 问答质量类指标名称英文全称定义与计算方式核心价值生产环境参考阈值答案相关性Answer Relevancy生成答案是否直接回应用户问题无答非所问、无关发散、避重就轻。衡量回答的切题程度避免“正确但没用”的答案≥ 0.85答案完整度Answer Completeness生成答案是否完整覆盖问题所需的全部信息要点无关键信息遗漏。衡量回答的信息充分性直接影响问题解决效果≥ 0.80拒答准确率Abstention Accuracy对于知识库无覆盖、无法回答的超纲问题模型能够正确拒答而非编造答案的比例。防控超纲场景的幻觉风险是线上幻觉的高发治理点≥ 95%逻辑一致性Logical Consistency答案内部前后表述无矛盾、推理链条连贯、因果关系成立的比例。避免多片段拼接导致的逻辑冲突、前后矛盾≥ 0.903. 表达质量类语言流畅度表述通顺、无语法错误、无生硬拼接人工评分 1-5 分参考基准 ≥ 4.2/5信息整合度多来源信息融合自然而非生硬罗列、重复堆砌人工评分 1-5 分参考基准 ≥ 4/5风格符合度回答语气、格式、专业度符合业务场景要求如客服话术、正式公文人工评分 1-5 分三、端到端整体效果指标业务视角站在最终用户与业务视角不拆解中间过程直接评估完整问答链路的交付价值。指标名称定义与计算方式核心价值生产环境参考阈值端到端问答准确率答案事实准确、完整回应用户问题、无幻觉的任务占总任务的比例。最直观的整体效果指标反映 RAG 系统的综合能力≥ 85%问题解决率用户问题通过 RAG 回答后无需进一步追问、无需人工介入的比例。直接对齐业务价值衡量 RAG 替代人工的能力客服场景≥80%内部知识库≥75%答案采纳率用户对回答点击采纳、认可、无负反馈的比例。线上真实用户的效果反馈比实验室评测更贴近实际≥ 80%用户满意度用户对回答的主观评分1-5分。综合反映回答的准确性、实用性、易用性≥ 4.0/5负反馈率用户点踩、投诉、要求转人工的任务占比。反向核心指标快速定位线上效果劣化≤ 5%四、系统工程与成本指标生产落地层面向生产环境的性能、成本与稳定性指标直接决定上线可行性与运维成本。1. 性能与时延检索时延向量检索粗排的耗时参考基准 ≤ 100ms首 Token 时延从请求发出到生成第一个字的耗时参考基准 ≤ 1s端到端总时延从用户提问到回答完全生成的总耗时参考基准 ≤ 3s吞吐量QPS单实例每秒可处理的请求数参考基准 ≥ 50支持水平扩展2. 成本与资源单请求 Token 消耗单次问答的上下文输出总 Token 数直接决定大模型调用成本单请求平均成本Token 费用 向量检索 重排等组件费用总和按业务预算设定阈值向量索引内存占用知识库对应的向量索引存储空间影响部署成本缓存命中率高频问题的缓存命中比例是成本优化的核心抓手3. 稳定性服务可用性接口正常服务的时间占比参考基准 ≥ 99.9%超时率请求超时的比例参考基准 ≤ 0.1%错误率请求返回系统异常的比例参考基准 ≤ 0.05%五、专项能力与鲁棒性指标针对特定 RAG 形态与复杂场景的专项评测指标。1. 多轮对话 RAG 专项多轮意图保持率多轮对话中Query 改写后不偏离用户原始意图的比例参考基准 ≥ 98%上下文记忆准确率跨轮次关键信息如用户前置条件、偏好被正确复用的比例参考基准 ≥ 95%话题切换准确率用户切换话题时检索与生成能正确切换知识领域的比例2. 多跳问答专项多跳召回率需要跨多个文档、多步推理的问题所有必要信息片段均被召回的比例推理链条完整度多步推理逻辑完整、无跳跃、无断层的比例3. 鲁棒性专项口语化输入衰减率口语化、非标准化提问相比标准提问的准确率下降幅度参考基准 ≤ 10%错别字容错率存在少量错别字的提问检索与生成效果的保持率参考基准 ≥ 90%长 Query 适配性长文本、多条件提问下的效果衰减率参考基准 ≤ 15%4. 知识库适配专项新增知识适配率新增知识库内容后对应问题的召回率与准确率提升幅度知识更新准确率知识库内容更新后回答同步更新、不输出旧信息的比例跨领域效果衰减率在未优化的新领域知识上的准确率下降幅度六、安全与合规指标金融、医疗、政务、法律等强监管场景的必选指标。敏感信息泄露率回答中泄露涉密内容、用户隐私、内部数据的任务占比需趋近于 0合规违规率输出内容违反行业监管规定如违规荐股、非法诊疗建议的比例需趋近于 0Prompt 注入绕过率通过注入攻击诱导模型绕过限制、输出违规内容的成功率需趋近于 0有害内容输出率输出暴力、歧视、低俗等有害内容的比例需趋近于 0不同业务场景的指标优先级差异显著法律/金融场景以忠实度、引用准确率、合规违规率为核心智能客服场景以问题解决率、拒答准确率、端到端时延为核心企业内部知识库以上下文召回率、答案完整度为核心。
返回列表