ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

如何用生成式AI数据增强扩展训练样本:一份从零上手的完整指南

如何用生成式AI数据增强扩展训练样本:一份从零上手的完整指南 如何用生成式AI数据增强扩展训练样本一份从零上手的完整指南【免费下载链接】awesome-generative-ai-guideA one stop repository for generative AI research updates, interview resources, notebooks and much more!项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-generative-ai-guide训练数据不够是很多人做 AI 项目时最先撞上的墙。开源项目 awesome-generative-ai-guide 把提示工程、微调、RAG 和评估的免费课程与资料整理在一起本文以它为地图带你完整走一遍生成式AI数据增强的落地路径从生成第一批文本样本到验证它们是否真的有用。样本太少时传统增强为什么失灵先说清楚增强这个词在两类任务里的差别。图像任务里的传统增强是旋转、裁剪、调色。它的逻辑是一张猫的照片转 90 度还是那张猫所以这些变体可以安全地当成新样本。文本任务不成立。把同一句客服对话同义替换一百遍模型看到的还是同一道题。数量上去了考点没变泛化能力不会真正提升。生成式AI数据增强换了个思路与其反复变换一道旧题不如请模型按同一考点出新题。保留知识点更换行业、措辞、细节和语气。打个比方学生刷题时把一道题换个数字重做和做一道全新的同考点题效果完全不同——你要的是后者。这个项目把完成这件事所需的材料分成了几个环节下面按使用顺序讲。用提示词批量生成第一批文本样本场景你手里只有二十条标注好的样本想扩到几百条。做法先给模型一份交代清楚的工单。提示工程课程把提示拆成四个要素指令、背景、输入数据、输出格式。批量生成样本时把这四样写进同一段提示再让模型基于种子样本改写、扩写。一个可以直接改用的提示长这样你是数据标注员。基于下面这条种子样本生成 5 条新的客服对话。 要求行业各不相同语气从礼貌到不耐烦问题都围绕退款 每条包含 3 轮对话最后一行用【标签】标注情绪positive/negative/neutral。 种子样本 顾客我的订单还没到什么时候能退 客服预计明天送达。如果你今天取消可以全额退款。 【标签】neutral效果跑一次就能拿到几十条格式一致的文本数据增强样本成本只有 API 调用费。生成后抽查格式是否统一、标签是否合理不合格的那一批重跑即可。想系统学习这一步可以看课程第 2 周的 提示工程章节。把生成内容整理成可训练的指令-输出对场景你打算做指令微调但语料散落在文档、工单、聊天记录里格式互不统一。做法按第 3 周微调课程的做法把每条数据统一成任务说明 正例 反例 输入 预期输出五段。让模型做转换喂一段零散语料让它输出符合这个结构的一条训练样本。转换本身也是一次合成样本生成只是产物更结构化。下面这张图来自课程左边是出题任务、右边是填空任务每条数据都能看清任务定义、注意事项、正反例和标准答案效果数据从能看变成能训。关键动作是抽检预期输出——模型生成格式没问题但答案对不对得靠一小批人工检查确认。微调章节 和 微调专题页 可以对照着看。知识不够时用检索增强生成给样本兜底场景你要生成的样本涉及具体产品参数、法规条文或公司内部规范。模型记不住这些容易凭空编。做法先把可信资料建成知识库——文档切块、做嵌入、存入索引。生成每条样本前先按主题检索出相关段落放进提示要求模型只依据这些材料来写。这就是 RAG 的三个环节摄取、检索、合成第 4 周课程有完整拆解。效果合成样本里的事实有了出处编造的概率明显下降。对知识密集型的任务这一步往往比换更强的模型更划算。RAG 章节 和 RAG 专题页 可以继续深入。用评估集验证合成样本是否真的有用场景你生成了一千条样本。下一步不是直接开训而是先回答一个问题它们到底有没有用做法留出一小份纯真实数据的参考评估集不参与任何生成。分别在只用原始样本和原始样本 合成样本两个条件下训练或评测。对比关键指标的变化再看几个典型错例判断提升来自哪里。AI Evals for Everyone 这门课专门讲评估怎么落地基准怎么建、指标怎么选、人工评估怎么结合。下图的公开模型榜单展示的就是同一思路用固定基准横向比较不同配置的表现。效果你得到的是一个可以复述的结论——合成样本让某项指标提升了 X 个百分点而不是一句感觉好点了。方法怎么选坑怎么避一张表选好方法方法适用场景成本见效速度提示词批量生成标注样本少需要快速扩量低只有 API 调用当天可用改写与句式变体已有样本但表达单一低当天可用指令-输出对合成准备做指令微调中需统一格式加抽检数天检索增强辅助生成样本依赖专业或最新知识中需先建知识库数天领域预训练加微调有海量领域语料但缺标签高需算力数周四个容易踩的坑合成样本彼此雷同。模型倾向于反复输出相似结构。生成时更换种子和设定事后抽样看重复率别只看数量。错误答案被放大。模型生成的标签本身可能错直接入训练集等于把错误焊进模型。用原始标注样本做锚点或请更强的模型复核后再入库。生成数据污染评估集。评估集必须只用真实数据否则你测的是模型的记性不是能力。合成占比一路加高。全部用合成数据训练容易过拟合模型自己的表达风格。保留一定比例的真实数据先小配比验证再上调。下一步生成式AI数据增强的本质是把数据不够从死局变成一道工程题先批量生成再整理成训练格式用检索补知识用评估兜底。完整课程材料在 Applied LLMs Mastery 2024其中 第 7 周构建 LLM 应用 会把本文讲到的环节放进完整的应用流程里适合作为收尾读物。【免费下载链接】awesome-generative-ai-guideA one stop repository for generative AI research updates, interview resources, notebooks and much more!项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-generative-ai-guide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表