少样本提示的示例选择策略:质量比数量更重要

少样本提示的示例选择策略:质量比数量更重要
少样本提示的示例选择策略质量比数量更重要在上一篇文章中我们讲了少样本提示的基本概念和使用方法。但很多同学在实际操作时会发现一个问题为什么我给了示例AI的输出还是不够好答案往往出在示例选择这个环节。今天我们就来深入聊聊少样本提示中最关键也最容易被忽视的问题——怎么选出好示例。一、为什么示例选择是最关键的一步1.1 一个让人意外的实验我先给大家看一个真实的对比实验。假设我们要让AI做情感分类任务——把商品评论分类为正面、“负面或中性”。实验A用5个随便选的示例示例1这个产品太棒了 → 正面 示例2还行吧能用。 → 中性 示例3质量很好物流也快。 → 正面 示例4一般般。 → 中性 示例5非常满意。 → 正面 请分类快递慢得令人发指但产品本身还可以。→实验B用3个精心挑选的示例示例1太棒了超出预期 → 正面 示例2非常失望完全不像描述的那样。 → 负面 示例3产品质量不错但物流太慢好坏参半。 → 中性 请分类快递慢得令人发指但产品本身还可以。→ 实验结果实验A中AI的输出准确率约为72%而且对于混合情感的评论经常分错实验B中准确率达到91%即便面对复杂评论也能稳定判断。同样的任务3个精选示例的效果远超5个随便选的示例。这就是我今天要讲的核心道理示例质量比数量重要得多。1.2 示例选择的本质是什么示例选择的本质是在做三件事定义边界告诉AI什么样的答案是对的什么样是错的展示标准告诉AI好的输出长什么样传达意图让AI理解你到底想要什么包括那些你没用语言说出来的期望一个差的示例不仅不能帮助AI理解你的需求反而会误导它。就像一个糟糕的教练教给学员的是错误动作。二、好示例的五个核心标准在大量实践中我总结出了判断一个示例好不好的五个维度。这五个维度构成了示例选择的品质检测清单。2.1 标准一典型性典型性是指示例能够代表你期望的大多数情况。一个好示例应该能展示正常情况下应该怎么处理。典型性高的示例让AI更容易抓住任务的核心模式。反例典型性差将以下商品名称标准化 示例iPhone15ProMax深空黑色512G → 苹果iPhone 15 Pro Max 512GB 深空黑这个示例的问题在于它展示的是一个极其复杂的变体含颜色、容量、型号全称但实际你需要标准化的可能是大量iPhone 15、“苹果15”、iP15这种简短写法。选一个极端复杂的示例AI可能会过度学习其中的复杂转换逻辑。正例典型性强将以下商品名称标准化 示例1苹果15 → iPhone 15 示例2华为M60 → 华为Mate 60 示例3三星S24 → 三星Galaxy S24这三个示例都是最常见的简称→标准名称映射AI学了之后能很好地泛化。2.2 标准二清晰性清晰性是指输入和输出之间的映射关系一目了然不存在歧义。一个清晰的示例AI看一眼就知道哦是这样变的。一个不清晰的示例AI需要猜测输入中的哪个部分对应了输出中的哪个变化。反例清晰性差将以下文本改写成正式风格 示例我觉得这个方案还行但是有些地方需要改一下。 → 经评估该方案整体可行但在若干细节层面存在优化空间建议根据以下意见进行修订①措辞需更严谨②数据支撑需补充。这个示例的问题在于输入只有一句话输出却变成了一个多层次的复杂回复AI无法清晰理解每个变化对应什么规则。正例清晰性强将以下文本改写成正式风格 示例1 输入 → 我觉得还行。 输出 → 我认为该方案基本可行。 示例2 输入 → 有些地方需要改。 输出 → 部分内容存在修订必要。 示例3 输入 → 你们得快点做。 输出 → 请尽快推进执行。每个示例的输入和输出长度相近变化规则清晰可见——“我觉得变我认为”、“需要改变存在修订必要”、“得快点做变请尽快推进”。2.3 标准三多样性多样性是指多个示例之间覆盖不同类型的输入帮助AI理解任务的变化范围。这是很多新手容易走极端的地方。要么所有示例都是同一种类型多样性不足要么示例之间毫无关联多样性过度。多样性的关键在于在一致的模式下展示变化的范围。✅ 好的多样性安排将产品问题分类为质量问题、物流问题、服务问题 示例1屏幕有坏点 → 质量问题 示例2快递包装破损 → 物流问题 示例3客服态度很差 → 服务问题 示例4商品与描述不符 → 质量问题四个示例覆盖了三种类型且质量问题给了两个不同表现的示例硬件缺陷、描述不符帮助AI理解质量问题的边界。2.4 标准四一致性一致性是指多个示例之间遵循完全相同的格式和判断标准。一致性是我见过最多人犯错的地方。很多人给了AI三个示例但三个示例的输出格式都不一样。⚠️ 不一致的示例常见错误示例1苹果 → 这是一种水果 示例2胡萝卜 → 蔬菜 示例3这是什么 → 这是牛肉属于肉类AI看到这三个示例后会困惑到底输出水果还是这是一种水果到底要不要这是和属于这些词到底用不用问句开头✅ 一致的示例示例1苹果 → 水果 示例2胡萝卜 → 蔬菜 示例3牛肉 → 肉类格式一致性对于控制AI的输出格式至关重要。一个格式不一致的示例会让之前在格式控制上做的所有努力功亏一篑。2.5 标准五覆盖边界覆盖边界是指示例中包含了边界情况——那些容易出错或模棱两可的输入。边界示例是少样本提示的秘密武器。一个包含边界示例的提示词鲁棒性会显著提升。典型边界情况包括混合情况同时包含两种类别的特征如产品质量好但物流太慢极端情况输入非常简短如只有一个字或非常冗长异常情况输入中包含拼写错误、乱码或不完整信息零样本情况输入中完全不包含关键信息举个实际的例子——情感分类任务情感分类任务正面/负面/中性 示例1非常好用强烈推荐 → 正面 示例2用了三天就坏了。 → 负面 示例3今天收到了。 → 中性 示例4边界产品本身不错但客服态度极差。 → 中性 示例5边界嗯。 → 中性示例4展示了混合情感的处理方式归为中性示例5展示了信息不足时的处理方式。这两个边界示例让AI在遇到类似棘手情况时不会乱猜。三、示例选择的四步操作法知道了好示例的标准后实际操作中怎么选出最佳示例呢我总结了一套四步操作法。3.1 第一步明确你的期望终点在选示例之前你必须先回答一个问题我到底希望AI输出什么用笔写下你对完美输出的定义包括内容标准必须包含什么不能包含什么格式要求用什么结构呈现质量标准什么算好什么算不合格风格定位严肃还是轻松专业还是通俗比如你想让AI帮你写产品卖点文案完美输出的定义 - 内容3个卖点每个卖点一句话不超过20字 - 格式用① ② ③编号分行 - 质量每个卖点要具体、有数据感不能空洞 - 风格口语化、有冲击力、适合电商详情页有了这个定义你选示例时就有了参照系——每个示例都要对齐这个标准。3.2 第二步准备候选示例池从你的实际使用场景中收集5-10个输入-输出对作为候选。这里有一个经验法则候选示例至少应该是最终使用数量的3倍。比如你打算用3个示例至少准备9个候选。候选示例的来源你自己手工写的理想输出最推荐之前AI生成得比较好的输出稍作修改同领域内其他人的优质案例注意版权从真实数据中筛选的标杆案例3.3 第三步用五个标准逐一筛选对每个候选示例用我们上面讲的五个标准打分1-5分标准示例1示例2示例3示例4示例5典型性54253清晰性55344多样性-----一致性-----覆盖边界-----注意多样性是针对示例组合的评分不是单个示例的。你需要看这一组示例放在一起是否覆盖了不同类型的输入。3.4 第四步组合测试与迭代选出排名最高的3-4个候选后将它们组合成提示词用几组不同的测试输入跑一下。重点观察稳定性相同类型的输入输出是否一致泛化性没见过的输入类型能否正确推广边界表现遇到边界情况表现如何如果某类输入总是出错说明你的示例组合对那类情况的覆盖不够需要替换一个示例。四、不同类型任务的选择策略不同任务对示例的要求不同。我按照最常见的几种任务类型给出针对性的选择策略。4.1 分类任务的选择策略分类任务是少样本提示最常用的场景。选择策略确保每个类别至少有一个示例且示例能展示该类别的典型特征和边界特征。新闻分类任务科技/财经/体育 示例1典型科技苹果发布新一代M4芯片性能提升50%。 → 科技 示例2典型财经央行宣布下调存款准备金率0.5个百分点。 → 财经 示例3典型体育中国队3比1战胜日本队晋级决赛。 → 体育 示例4边界NBA与Coinbase达成加密货币赞助协议。 → 财经示例4是体育财经的边界情况AI需要学习当一条新闻同时涉及两个领域时按哪个标准分类。对于类别不平衡的情况如90%的输入是科技只有少量财经和体育我建议⚠️不要在示例中反映真实的比例分布而是给每个类别相等数量的示例。否则AI会倾向于把大部分输入都分到多数类。4.2 生成任务的选择策略生成任务写文案、写代码、写摘要等的示例选择比分类任务更难。因为好没有绝对标准。对于生成任务示例选择的核心策略是展示优秀输出的典型特征而不是试图覆盖所有可能的变化。具体做法选择2-3个能代表你审美标准的示例示例之间展示不同的风格维度如一个偏数据驱动、一个偏情感叙事示例的长度和复杂度要与你的实际需求匹配写产品卖点文案的示例选择 示例1数据驱动型 产品降噪耳机 卖点① 42dB深度降噪地铁变图书馆 ② 40小时续航一周不用充电 ③ 0.05秒低延迟游戏音画同步 示例2场景体验型 产品保温杯 卖点① 早上倒的开水下班还在冒热气 ② 杯盖一按就开开车单手喝水超方便 ③ 316不锈钢内胆可乐果汁随便装不留味两个示例展示了两种不同的卖点写法风格但格式完全一致三个卖点每个有数字或细节支撑。AI可以从中学到格式要求和风格弹性。4.3 推理任务的选择策略推理任务数学、逻辑、分析等的示例选择最重要的是展示思考过程。选择能清晰展示从已知到结论的推导路径的示例。推理示例的黄金结构输入[问题] 思考过程 1. [第一步推理] 2. [第二步推理] 3. [第三步推理] 结论[最终答案]示例选择时优先选步骤数量适中的示例3-5步为佳太少看不出过程太多显得冗长逻辑跳跃尽量少的示例每一步之间因果关系明确包含为什么这样想的解释不只说怎么做还说为什么4.4 格式转换任务的选择策略格式转换JSON转表格、自然语言转SQL、文本转Markdown等的示例选择相对简单。核心策略示例的输入复杂度要覆盖你的实际使用场景且输出格式必须100%一致。自然语言转SQL 示例1简单查询查询所有用户的姓名和邮箱 → SELECT name, email FROM users; 示例2条件查询查询年龄大于18岁的男性用户 → SELECT * FROM users WHERE age 18 AND gender 男; 示例3聚合查询统计每个部门的平均工资 → SELECT department, AVG(salary) FROM employees GROUP BY department;三个示例的复杂度递进覆盖了SELECT的基础模式、条件过滤和聚合操作。输出格式完全一致SQL语句以分号结尾关键字大写。五、示例选择的三个常见误区5.1 误区一越多越好这是最常见的一个误区。很多人的直觉是示例多AI学得就多效果就好。真实情况是1-2个示例有时不足但有时够了3-5个示例大多数任务的甜点区间6-10个示例边际收益很低10个以上可能起反作用⚠️ 示例过多有两个坏处第一个坏处稀释注意力。当示例太多时AI分配给理解最近几个示例的模式的注意力会被分散。LLM对提示词中位置靠后的内容通常给予更多权重中间位置的大量示例可能反而被忽略。第二个坏处增加噪声。示例越多越难保证每个示例都完美。只要有一两个不够好的示例混进去就会拉低整体效果。而且示例越多出现示例之间不完全一致的概率越大。5.2 误区二选最好的case有些人喜欢把自己能想到的最完美的输出作为示例。这看起来没问题但实际上可能适得其反。⚠️如果示例太完美AI可能会把完美当成模式的一部分导致它输出的东西用力过猛。比如教AI写标题如果你的3个示例全都是震惊XXXXX第3个让人泪目这种爆款风格AI学到的可能不是写吸引人的标题而是必须用震惊体 更好的做法示例中混合好和还不错的水平展示一个合理的质量区间。5.3 误区三只用正面示例很多提示词中只有要这样做的正面示例没有不要这样做的反面示例。实际上反面示例负面示例是极其有效的教学工具。告诉AI什么是错的往往比告诉它什么是对的更直观。✅ 正面负面示例的组合用法写一段产品介绍。 ✅ 好的示例请模仿 这款跑鞋的中底采用了全新EnergyBoost科技每一步落地都能感受到明显的回弹。 经过300公里实测鞋底磨损仅为普通跑鞋的40%。 ❌ 差的示例请避免 这是一款很好的跑鞋质量非常好穿着很舒服推荐大家购买。 问题空洞无物没有具体细节全是大词空话 请按照✅好的示例的标准为以下产品写介绍xxx负面示例让AI明确知道什么特征是要避免的配合正面示例双重锁定输出方向。六、高级策略动态示例选择6.1 什么叫动态示例选择前面的讨论都基于固定示例——写提示词时就确定好用哪些示例。但在实际应用中有一种更高级的做法叫动态示例选择根据当前的具体输入动态地从示例库中选择最相关的几个示例。就像一个好的老师会根据学生问的具体问题选择最合适的例子来讲解。6.2 相似度选例法最常用的动态选择策略是基于相似度动态示例选择的流程 ① 维护一个标注好的示例库比如100个高质量示例 ② 当新的输入到来时计算输入与示例库中每个示例的相似度 ③ 选择相似度最高的2-3个示例放入提示词 ④ 用这些定制的示例去引导AI处理当前输入相似度计算可以用简单的关键词重叠、TF-IDF向量相似度或者用embedding向量做语义相似度匹配。6.3 难度分级选例法另一种策略是根据输入的难度来选择不同类型的示例。对于简单输入用基础示例展示标准处理流程对于复杂输入用进阶示例展示如何处理边界情况和异常情况判断难度 → 选择对应难度级别的示例 → 组成提示词 → 调用AI6.4 动态选择的意义动态示例选择虽然实现成本比固定示例高但在以下场景下收益巨大输入多样性极高的场景如开放域问答需要高精度的场景如医疗、法律文本处理示例库持续积累的场景随着使用示例库越来越丰富七、实战案例从头构建一个高质量的少样本提示词让我用一个完整的实战案例带你走一遍从零开始选择示例的全过程。7.1 任务描述任务让AI从一段对话记录中提取行动项to-do items包括谁要在什么时候之前完成什么。7.2 第一步定义期望输出完美输出的标准 - 每条行动项包含三个字段负责人、截止时间、任务描述 - 用JSON数组格式输出 - 如果对话中没有明确的行动项返回空数组 - 任务描述要基于对话内容具象化不能照搬原文7.3 第二步准备候选示例我准备了10个候选示例来自真实会议记录举其中3个候选A典型会议对话输入小王你下周五之前把那个需求文档写完。 输出[{负责人: 小王, 截止时间: 下周五, 任务描述: 完成需求文档的撰写}]候选B多个行动项输入老李你明天把合同发给客户。小张你后天之前把测试环境搭好。 输出[{负责人: 老李, 截止时间: 明天, 任务描述: 将合同发送给客户}, {负责人: 小张, 截止时间: 后天, 任务描述: 搭建好测试环境}]候选C没有明确行动项输入我觉得这个方案挺好的大家觉得呢 是的我也觉得可以。 输出[]7.4 第三步用五标准筛选我对10个候选逐一打分后选出以下3个作为最终示例候选A典型性5清晰性5——入选。最标准的单个行动项场景候选B典型性4清晰性5多样性价值高——入选。展示多个行动项的提取候选C边界覆盖价值极高——入选。展示无行动项时返回空数组7.5 第四步组合成最终提示词将选好的示例与任务说明组合你需要从对话记录中提取行动项。每条行动项包含负责人、截止时间和任务描述。 格式要求用JSON数组输出每个元素是一个对象包含负责人、截止时间、任务描述三个字段。 如果对话中没有明确的行动项返回空数组[]。 示例 示例1 对话小王你下周五之前把那个需求文档写完。 输出[{负责人: 小王, 截止时间: 下周五, 任务描述: 完成需求文档的撰写}] 示例2 对话老李你明天把合同发给客户。小张你后天之前把测试环境搭好。 输出[{负责人: 老李, 截止时间: 明天, 任务描述: 将合同发送给客户}, {负责人: 小张, 截止时间: 后天, 任务描述: 搭建好测试环境}] 示例3 对话我觉得这个方案挺好的大家觉得呢 是的我也觉得可以。 输出[] 请处理以下对话 对话小陈今天把那个bug修了。还有小红下周一把用户手册更新一下。 输出7.6 效果验证用这个提示词测试了20组不同的会议对话行动项提取准确率94%比用5个随便选的示例高了18个百分点格式正确率100%所有输出都是合法的JSON数组格式空对话处理正确率100%没出现幻觉行动项隐式行动项提取76%如这个功能需要有人看看这类含蓄表达部分能识别这个案例说明3个精心挑选的示例在实际任务中的表现显著优于更多但随便选的示例。八、示例选择的工具与方法8.1 建立你的示例库 我强烈建议你花时间建立自己的示例库。这是一个一次投入长期受益的事情。示例库的结构建议示例库/ ├── 分类任务/ │ ├── 正面示例_情感分类.json │ ├── 边界示例_混合情感.json │ └── 负面示例_违规内容.json ├── 生成任务/ │ ├── 文案风格A_数据驱动型.json │ ├── 文案风格B_情感叙事型.json │ └── 文案风格C_简洁速读型.json ├── 推理任务/ │ ├── 数学推理_简单.json │ ├── 数学推理_复杂.json │ └── 逻辑推理.json └── 格式转换/ ├── 自然语言转SQL.json └── 文本转JSON.json每个示例记录这些元信息任务类型适用场景示例质量评分1-5已知缺陷对哪些输入表现不好使用次数和效果记录8.2 用AI辅助筛选示例有趣的是你还可以用AI来帮你筛选示例。这是元提示词的一个经典应用你是一个示例质量评估专家。请评估以下候选示例是否适合用作 [任务描述]的少样本提示示例。 评估标准 1. 典型性是否能代表常见情况 2. 清晰性输入输出映射是否清楚 3. 格式一致性是否与你期望的输出格式一致 请你对以下5个候选示例逐一打分1-5分并说明每个示例的优缺点。 然后推荐3个最佳的作为最终选择。 候选示例 [列出候选示例]这个用AI评估AI的方法可以帮你从大量候选中快速筛选出最优示例。8.3 迭代优化流程示例选择不是一锤子买卖。我推荐的迭代流程是① 选择初始示例组合 → ② 小范围测试10个测试case → ③ 分析失败case → ④ 定位是哪个示例的问题 → ⑤ 替换问题示例 → ⑥ 回到②直到满意通常2-3轮迭代就能找到比较好的示例组合。关键是第③步和第④步——你要能准确判断出错的根本原因。核心要点总结✅示例质量比数量更重要——3个精选示例的效果通常优于5个以上随便选的示例。不要迷信数量要在精选上下功夫。✅好示例的五个标准典型性代表常见情况、清晰性映射关系一目了然、多样性覆盖不同类型、一致性格式和标准统一、覆盖边界包含边界情况。✅四步操作法①明确期望终点 → ②准备候选示例池 → ③用五标准筛选 → ④组合测试迭代。把示例选择变成一个可复现的流程而不是凭感觉。✅不同任务不同策略分类任务关注类别覆盖生成任务关注质量标准展示推理任务关注思考过程展示格式转换任务关注输出一致性。⚠️三个常见误区①示例越多越好错3-5个是甜点区间②只选最完美的示例错示例太完美可能导致AI用力过猛③只用正面示例错负面示例是极其有效的教学工具。进阶策略动态示例选择可以根据当前输入的特点从示例库中自动选择最相关的示例在输入多样性高的场景下效果提升显著。长期投资建立自己的示例库记录每个示例的适用场景和效果让示例资产不断积累和增值。