ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

双非AI求职备战 Day 4-10:为校园AI助手装上“知识大脑“(RAG实战)

双非AI求职备战 Day 4-10:为校园AI助手装上“知识大脑“(RAG实战) 什么是RAG为什么要用RAGRAG 定义RAG Retrieval-Augmented Generation检索增强生成简单一句话先检索、再生成。 大模型本身有固定的训练知识库存在知识滞后、不知道你的私有资料中北大学校园资料RAG 把本地私有文档你的校园 FAQ、校情介绍、培养方案向量化存入向量数据库。用户提问时把用户问题转为向量去向量库检索最相关的片段检索阶段将检索出来的参考资料连同用户问题一起塞给大模型大模型基于给的参考资料来组织语言回答生成阶段✅私有知识GLM 大模型的训练数据里没有最新中北选课、图书馆、校内通知这类专属校园资料不做 RAG 它会瞎编。✅减少幻觉强制 AI 必须基于提供的文档回答没有资料就回答 “暂无相关信息”不能编造。✅低成本不用微调大模型只准备文本知识库节省算力和时间非常适合毕设。✅可更新校园政策变了只需要更新 txt 知识库重建向量库不用重新训练模型。✅控制上下文长度不会一次性把全部校园文档丢给大模型只把和问题相关的片段传入节省 token、降低接口费用。如何准备和清洗校园数据校园数据是 RAG 系统的知识底座数据质量直接决定回答效果。建议从以下三个维度准备和清洗数据来源优先收集教务处选课通知、图书馆开放时间、校历、培养方案、校园 FAQ 等官方文档确保信息权威、口径统一。清洗要点去除页眉页脚、广告和重复段落统一日期、时间、地点等格式对 PDF 转文本产生的乱码和多余换行做归一化处理。组织方式按主题拆分文档如选课、宿舍、图书馆每个主题下保留完整语义段落便于后续按块切分时保持上下文连贯。文本分割的技巧chunk_size、chunk_overlap 怎么调文本分割直接影响检索召回质量建议按以下思路调参chunk_size一般从 200 到 500 字起步。校园问答多为短句建议先用 300 字左右测试再根据回答完整度微调。chunk_overlap建议设为 chunk_size 的 10% 到 20%避免关键信息恰好被切在边界上导致漏检。验证方法准备一组典型校园问题逐个检查检索结果是否命中正确答案据此反向调整参数。中文嵌入模型的选择为什么用 paraphrase-multilingual-MiniLM-L12-v2该模型支持中文在内的多种语言体积小、推理快适合毕设场景在本地 CPU 上运行。它能把中文问句和校园文档映射到同一向量空间保证跨语言和同语言检索都能取得稳定效果。向量检索的原理和效果展示向量检索的核心是把用户问题编码为向量再与知识库中的文档向量计算相似度返回最相关的若干片段。效果展示建议包含检索命中的原文片段、相似度得分以及最终生成的回答方便直观对比不同参数下的表现。踩坑记录编码问题模型下载太慢常见问题包括读取 txt 时中文乱码建议统一用 UTF-8 编码、模型首次下载较慢可提前下载到本地缓存、向量库重建耗时建议增量更新而非全量重建。把这些坑记录下来既能帮助自己排查也能让读者少走弯路。
返回列表