
RAG完整描述标准 RAG 全流程每一步的作用标准 RAG 分为知识库构建和在线问答两大阶段完整流程共有六步文档加载与清洗加载 PDF、Word、网页等原始数据清洗乱码、空行、无效内容统一文档格式保证数据源质量。文本分片Chunk将长文档切割为固定长度的文本块解决上下文窗口限制适配向量检索。向量化存储通过 Embedding 模型将文本转成向量连同元数据存入向量数据库。用户 Query 预处理对用户提问做纠错改写、拓展脱敏优化检索语义提升召回精度。多路召回加重排序通过向量语义检索加 BM25 关键词检索召回候选文本再通过 Rerank 模型精排筛选最相关内容。大模型生成回答将筛选后的上下文加用户提问加系统提示词传入 LLM 约束模型基于知识库内容作答杜绝幻觉。一句话RAG 整体分为两步先建库再问答。建库加载文档、清洗切块、转向量存到向量数据库。问答优化用户问题检索相关内容精排筛选最后让大模型拿着检索到的资料回答问题避免瞎编。原生RAG存在哪些痛点简单Demo RAG和企业RAG差距在哪数据层(a) Demo无数据清洗增量更新。(b) 生产级支持文档清洗、去重、增量同步、过期数据清理。检索层(a) Demo仅简单向量检索。(b) 生产级多路召回加 Rerank、Embedding 加 Query 优化。工程层(a) Demo无并发、限流、缓存、监控。(b) 生产级支持高并发、熔断降级、全链路监控。权限层(a) Demo无权限。(b) 生产级支持细粒度文档权限、用户隔离。迭代层(a) Demo无评测。(b) 生产级有完整量化评测、日志分析、迭代优化机制。文档切片Chunking有哪些策略常用切片策略固定字符切分、语义切分、层级切分标题分层、递归字符切分、章节切分。固定长度切分优缺点优点是速度快、成本低、适配所有文档、易于落地缺点是容易切断语义、拆分句子、割裂上下文导致检索内容不完整。语义切分优缺点优点是按语义边界切块不割裂上下文检索精度极高缺点是速度慢、算力成本高、耗时久长文档处理效率低。生产最优方案递归字符切分适度重叠兼顾效率与语义完整性。固定切块速度快但容易把一句话、一个知识点切开语义切块按内容逻辑分割检索更准但慢、耗资源。项目里一般用递归切块搭配重叠策略平衡速度和准确率。Chunk重叠作用是什么重叠值一般设置多少重叠就是两块内容有一点重复防止关键知识点刚好被切在缝隙里导致检索不到。一般重叠设置为块大小的 15% 左右既能保证语义完整又不会重复数据太多浪费资源。文档加载支持哪些格式PDF、Word、网页文档解析常见的坑是什么PDF 扫描版无法提取文本公式乱码排版错误页眉页脚冗余分页截断。Word 格式标签残留表格解析错误多级标题混乱隐藏内容冗余。网页 HTML广告冗余导航栏重复标签代码残留内容噪声多。通用问题共行特殊符号乱码重复内容无效注释影响检索精度。解决方案文档预处理、清洗去重、过滤噪声、OCR 识别扫描件、结构化解析表格标题。什么是多路召回稠密向量检索BM25关键词混合检索召回好处多路召回就是同时用语义检索和关键词检索找内容向量检索懂意思。BM25精准匹配专有名词、数字。两者结合既能听懂用户白话提问又不会漏掉专业关键词检索准确率提升明显。什么是Rerank重排序为什么检索之后需要重排重排序就是把初步检索出来的内容用专门的金牌模型重新打分把最相关的内容放前面无关的过滤掉。因为初步检索只是粗略匹配精度不够必须重排才能保证给大模型的资料都是精准有效的。检索是设置的Top-k依据是什么K值过大或者过小会出现什么问题K 就是检索返回的条数太小资料会不够答不全。太大会带进很多垃圾内容占用窗口让模型瞎编还增加成本。项目里一般做法是粗排多10-20条重排后筛选最优的 3~5 条给模型。如何选择Embedding模型评估embedding效果有哪些指标中文项目就用专门的中文向量模型私有化部署就用开源轻量模型线上商用用高精度模型。评估好坏主要看能不能把相关内容都召回来少召回垃圾内容用召回率、精确率这些指标衡量。向量数据库是什么对比传统数据库为什么不能直接存储向量向量数据库是专门存向量、做相似度搜索的数据库。MySQL 这类传统数据库只能精准查数据不能做语义模糊匹配海量向量检索超级慢完全不适合 RAG 场景所以必须用专用向量库。Milvus、Qdrant、Chroma、RedisVector、FAISS对比分别适合什么场景线上大规模生产项目用Milvus稳定能扛并发小型私有化项目用Qdrant本地测试跑Demo用Chroma高频少量数据缓存用RedisVector离线算法测试用FAISS。Milvus索引类型FLAT、IVF_FLAT、HNSW适用场景区分?FLAT暴力检索全量向量精准匹配精度100%速度最慢。适用场景小体量数据、离线精准检索、测试验证IⅦ_FLAT倒排索引聚类分桶检索速度中等、精度较高支持海量数据。适用场景平衡精度与速度的常规生产业务3.HNSW层次化小世界索引图索引结构检索速度极快、延迟极低精度高内存占用高。适用场景线上高并发、低延迟核心业务是企业主流选型。FLAT 最准最慢适合小数据测试IVF_FLAT 速度和精度均衡适合普通业务HNSW 速度最快、延迟最低适合线上高并发的核心问答业务生产基本都用这个。什么是GraphRAG和普通向量RAG相比适合什么类型知识普通 RAG 只会匹配相似文本Graph RAG 能识别实体和关系做关联推理适合有关系、有链路的复杂知识。什么是self-Rag相比基础RAG有什么改进普通 RAG 不管用户问题要不要检索都固定查库Self-RAG 让模型自己判断。简单问题直接答难的问题再检索还会自己校验资料对不对不够就补充。Query改写/QUery拓展是什么为什么要预处理用户提问用户提问经常口语化不完整、有歧义直接检索不准。所以我们会优先优化问题补全关键词改写标准问句让检索能精准匹配到对应的知识库内容避免答非所问。如何解决RAG上下文溢出问题生产级上下文溢出解决方案优化分块策略减小单Churk 长度细化切块粒度减少单轮输入Token量严控检索条数限制 TopK数量只保留高相关内容过滤冗余信息上下文压缩通过模型精简检索内容、去除冗余语句保留核心信息滑动窗口截断对话历史采用滑动窗口只保留最近轮对话分层检索长文档采用摘要检索细节检索分层加载避免全量灌入选用更大上下文窗口模型从底层提升容量。RAG系统如何降低幻觉检索优化多路召回Rerark精排保证输入模型的上下文精准有效提示词约束强制模型「仅基于检索内容作答无对应信息直接告知未知禁止编造」内容校验增加检索内容真实性校验、答案溯源校验禁止脱离知识库数据治理清洗知识库噪声、过期数据保证底层数据源准确结果后处理敏感信息、不确定内容过滤自动纠错修正模型微调领域微调对齐输出规范减少编造习惯。知识库文档更新增量同步怎么做怎么处理过期数据通过文件指纹和更新时间判断文件变动新增的直接入库修改的删旧存新删除的直接下线。用消息队列做异步更新同时定期清理过期数据保证知识库内容实时准确。如何做RAG权限控制实现不同用户只能检索对应文档为每一条知识库内容打上权限标签绑定用户和角色。用户查询的时候先根据权限过滤内容只能查到自己有权限的文档实现精准的权限隔离避免数据越权访问如何量化评估一套RAG系统好坏有拿下额评测指标检索层召回率精确率检索耗时生成层答案准确率完整性相关性幻觉率业务层用户满意度回答通过率会话耗时率评测方式构建标准测试 数据集自动化批量评测人工抽样校验评估 RAG 好不好主要看以下几个方面能不能召回全准的资料答案对不对、完不完整、有没有瞎编用户满意度接口响应速度。我会用标准数据集做自动化评测再配合人工抽检迭代。什么是多模态RAG图片表格类数据如何构建知识库多模态 RAG 能处理图片和表格内容表格通过解析成结构化文本。图片用 OCR 识别文字加 AI 生成内容描述。统一转成向量入库实现图片、表格的检索和问答。检索到无关文档会带来什么负面影响如何规避检索到无关内容会让模型答错瞎编还会浪费资源、拖慢速度。我通过优化问题多路检索、重排过滤设置相似度阈值层层过滤垃圾内容保证传给模型的资料都是精准相关的。文本分块时标题元数据如何处理要不要嵌入向量分块的时候我会把标题、章节信息拼在每一块内容前面一起转向量提升检索准确度。文档来源、时间这些元数据单独存用来做过滤溯源不单独向量化避免碎片化。Agentic RAG是什么普通RAG核心区别普通RAG是固定流程查一次库答一次题只能解决简单问题。Agentic RAG结合了智能体能力能拆机负责问题多次检索调用工具自助校验社会处理负责的多步骤回答场景。