ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

【RAG 学习笔记 05】怎么证明你的 RAG 好用:评测、排查与三个进阶架构

【RAG 学习笔记 05】怎么证明你的 RAG 好用:评测、排查与三个进阶架构 这是 RAG 学习笔记的第 5 篇也是最后一篇。前几篇都在讲怎么搭这一篇讲**“怎么证明它好用、坏了怎么查、还能怎么升级”**。本系列导航00 开篇用「开卷考试」理解 RAG 与我的学习方法01 Chunking 切块与 Embedding 选型02 在线链路七步走与混合检索 RRF03 Rerank 与查询改写04 工程化延迟、缓存、成本与权限05 评测调优与三个进阶架构本篇一、评测集怎么建来源按价值排序优先级来源为什么1真实生产查询近 30–90 天分层采样最贴近真实分布2客服升级工单人工介入的问题正是难题3事故报告边界案例已知会翻车的地方4合成问题仅作兜底且要标记区分必须覆盖的问法事实查找、总结、多文档推理、否定式提问、时效性问题、无答案样本。举例200 条评测集的构成——120 条真实查询50 条客服工单20 条边界案例10 条合成问题关键无答案样本占 10–15%用来测拒答能力。为什么必须有无答案样本因为如果评测集里全是有答案的问题系统就会学会编答案——它永远不需要说我不知道。这一条我印象极深。二、Faithfulness vs Answer Relevance两个指标别混指标在问什么公式 / 含义Faithfulness忠实度答案是否完全由检索上下文支持受支持声明数 / 总声明数Answer Relevance答案相关性答案是否真正回应用户问题答案与问题的相关程度举例法律合同 RAG用户问合同解除后违约金怎么算模型答违约金按合同总额的20%计算上下文里有这个条款 →Faithfulness 1.0模型答违约金按合同总额的30%计算上下文里没有 →Faithfulness 0关键组合判断Faithfulness 高但 Relevance 低 → 说明检索内容偏题。举例用户问退款要几天模型回答会员年卡权益包括……——它说的都对忠于上下文但没回答问题所以问题出在检索召回的内容偏了。门槛受监管行业法律 / 医疗 / 金融设0.98低于则替换为拒答。这两条我最后是这么记的**Faithfulness 管有没有编Relevance 管有没有答到点上。**一个查生成、一个查检索。三、效果差怎么排查七问链路按链路从上到下逐段排查资料库里有没有答案源头问题最容易被忽略Chunk 切分有没有切断关键信息召回 Top-K 里有没有正确文档Rerank 后正确文档还在不在前面上下文有没有超长被截断Prompt 是否约束了只根据上下文回答LLM 是否忽略了上下文举例技术文档 RAG正确文档在召回 Top-50 里排第 35Rerank 后仍未进 Top-10 → 定位为Rerank 模型不敏感→ 换领域微调 Reranker 后提升到第 2 名。核心逻辑先查上游再查下游。上游问题会传导到下游。这七问是我觉得整份文档里最像工程手册的一部分。它把效果不好这种模糊抱怨变成了七个可验证的假设——这是可以背下来直接用在面试里的东西。四、三个进阶架构加分项4.1 GraphRAG解决多跳推理问题传统 RAG 是扁平检索难以回答需要多跳推理的问题。举例用户问张三的上级的上级是谁传统 RAG检索张三的上级→ 李四再检索李四的上级→ 王五需要两次GraphRAG沿汇报关系边遍历两跳直接返回王五。代价构图成本高、维护复杂。4.2 Agentic RAG让模型自己决定怎么检索固定流水线Agentic RAG行为检索一次 → 生成一次模型动态决定何时检索、检索什么、检索几次举例技术客服正确率 0.78延迟 1.2 秒先判断需要检索 → 发现质量低 → 自动改写查询 → 重新检索 → 正确率 0.89延迟 2.5 秒权衡正确率11 个百分点但延迟翻倍。所以简单问题用固定流水线复杂问题用 Agentic RAG。4.3 多模态 RAGCLIP 管图片BGE 管文字实现索引图片用CLIP做 Embedding文本用BGE做 Embedding检索同时检索文本和图片生成多模态 LLMGPT-4V、Qwen-VL同时接收文本和图片。CLIP 和 BGE 分别是什么CLIPOpenAI 出的多模态模型能把图片和文字映射到同一个向量空间。一张按钮的截图和文字按钮在向量空间里很接近所以能用文字搜图片BGE文本Embedding 模型把文字变成向量。举例产品手册 RAG用户问这个按钮在哪纯文本 RAG正确率0.62多模态 RAG检索到包含该按钮的截图 → 正确率0.85五、实习面试速成路径文档给的四周计划周目标内容第 1 周建立框架背熟完整链路离线 在线、RAG vs 微调、Chunking / Embedding / 混合检索 / Rerank 基本概念第 2 周深入核心RRF 公式与原因、双塔 vs 交叉、HNSW 的 M 与 ef_construction、查询改写的风险与兜底第 3 周工程能力延迟优化、成本控制、多轮对话、权限控制、评测集建设第 4 周模拟面试每个问题用口述版回答、准备 2–3 个项目举例、练习追问链应对面试模拟我练过的四问Q1什么是 RAG“RAG 全称 Retrieval-Augmented Generation核心是让大模型回答前先从外部知识库检索相关证据再基于证据生成答案。链路分两阶段离线做文档解析、切块、向量化、建索引在线做查询改写、混合检索、Rerank、上下文组装、LLM 生成。我在上一家公司做企业客服 RAG知识库 3 万篇产品文档上线后客服人工介入率从 35% 降到 12%。”Q2Chunk_size 怎么定“没有固定最优值必须在真实评测集上比较。常见起点 300/500/800 tokenoverlap 设 10–20%。我们做技术文档 RAG 时对比了固定 512、递归切分、语义切分三种策略最终选递归切分因为技术文档结构规整、标题边界比语义边界更可靠Recall10 达到 0.85。”Q3Rerank 为什么必要“召回阶段是双塔粗排Query 和 Doc 独立编码交互不充分Rerank 用 Cross-Encoder 拼接后联合编码精度更高但慢所以只对少量候选精排。我们做法律合同 RAG 时正确文档在召回 Top-50 里排第 35Rerank 后提升到第 2答案正确率从 0.62 提升到 0.89。”Q4检索为空怎么处理“三层处理第一层放宽条件重试——降阈值、去过滤、启用 BM25 兜底第二层明确拒答——Prompt 约束’上下文无相关信息时直接说未找到’第三层追问用户澄清。高 stakes 领域应配置受控拒答核心原则是宁可拒答不可幻觉。”最难的知识点总结文档原表难点核心理解举例RRF只看排名不看分数避免量纲不一致BM25 和向量分数不可直接比较Rerank双塔粗排 vs 交叉精排正确文档从第 35 名提升到第 2 名HNSWef_construction 2*M否则图质量永久受损Faithfulness受支持声明 / 总声明上下文有20%模型说30%则 0查询改写把它还原成实体“它退款怎么算→会员年卡的退款条件”多轮对话每轮 Query 必须自包含不能依赖上一轮文档GraphRAG多跳推理“张三的上级的上级”【此处有图RAG 完整链路图离线索引 在线检索生成 评测与兜底】六、我的下一步文档最后给了四条动手建议我打算照着做动手跑一遍用 LangChain 或 LlamaIndex 搭一个最小 RAG体验完整链路建一个小评测集20 条问题测 Recall10 和 Faithfulness调一次 HNSW 参数感受 M 和 ef_construction 对召回和延迟的影响模拟面试找朋友问上面的问题用口述版回答。七、系列总结RAG 到底在解决什么回头把六篇串起来我的整体理解是RAG 就是把开卷考试工程化离线把书整理好切块、索引在线把问题问清楚清洗、改写、把书翻准混合检索、Rerank、把答案抄对组装、生成、引用。而每一块的核心矛盾也很清楚环节核心矛盾平衡手段切块块大→信息全但不精准块小→精准但易断overlap、按结构切检索字面匹配 vs 语义匹配混合检索 RRF排序快双塔vs 准交叉粗排 Top-50 → 精排 Top-5生成上下文长→准但慢/贵只放 3–5 个 chunk、流式输出安全答得多 vs 答得对拒答优先、检索期权限过滤如果只让我记一句话我会记这条上限在离线决定效果在在线争取可信度靠会拒答。本系列完
返回列表