ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

解密prompt系列34. RLHF之训练另辟蹊径:循序渐进 青出于蓝

解密prompt系列34. RLHF之训练另辟蹊径:循序渐进  青出于蓝 前言前几章我们讨论了RLHF的样本构建优化和训练策略优化这一章我们讨论两种不同的RL训练方案分别是基于过程训练和使用弱Teacher来监督强Student循序渐进PRM ORMSolving math word problems with processandoutcome-based feedbackPRMLet’s verify step by stephttps://github.com/openai/prm800k### 数据标注想要获得过程监督所需的标注样本其实是一件成本很高事情因为需要对解题的每一个步骤是否正确进行标注。论文选择了3分类的labelpositive是推理正确合理negative是步骤错误或逻辑错误neural是模糊或者存在误导。如下为了让高昂的标注过程产生最大的价值这里需要保证生成解题样本的格式规范容易拆分成多个解题步骤以及样本不能全是easy negative或者easy positive。也就是我们需要解决推理格式和样本筛选问题。为了保证稳定的推理格式这里论文训练了Generator使用’\n’来分割每一步解题步骤。为了避免这一步微调导致样本信息泄露论文使用few-shot构建格式正确的推理样本后过滤了答案正确的样本只使用答案错误但格式正确的样本训练Generator。更大程度保证微调只注入推理格式不注入额外数学知识和推理信息。在样本筛选步骤论文使用当前最优的PRM模型筛选打分高但是答案错误的Convincing wrong answer答案来构建更难过程监督信号更多且PRM对当前解题过程一定存在至少一步判断错误的样本来进行人工标注。既然看到这里是使用PRM打分筛选样本来训练PRM自然使用到了Iterated Training也就是会先构建一波样本训练一个PRM用新训练好的PRM对问题的N个回答进行打分再筛选Top K的Convincing wrong answer去进行人工标注再训练PRM这个过程总共迭代了10次。最终得到了PRM800K解题步骤的训练样本包括从12K问题中采样得到的75K答案。ORM的训练样本就简单很多只需要用到问题的答案即可。不过考虑到上面PRM对样本进行了有偏筛选得到的大多是答案错误的样本因此ORM的样本是在相同问题上用Generator重新随机生成的。所以ORM和PRM的回答样本并不相同。训练和推理训练阶段ORM是预测最终答案正确与否的positive/negative分类目标PRM的目标是预测每一个解题步骤的positive/neural/negative这里论文没有做任何解题步骤前后关联单纯把每个解题步骤独立作为一个分类样本进行训练因此和ORM一样是分类任务。论文同时提到因为预训练LM和分类CLM的目标差异巨大因此低LR的训练得到的PRM更加稳定不论模型大小都只训练2个Epoch这里虽然感觉PRM这个每个解题步骤条件独立的假设有一些强但确实如果按不独立来标注那标注成本会再高一个数量级也是不太现实~推理阶段论文给出了两种PRM的推理方案。一种是使用PRM计算每一步推理正确的概率再把多个推理步骤的得分求积得到每个答案唯一的打分用来比较同一个问题多个回答之间的优劣。一种是预测第一个错误的步骤这样PRM和ORM会先对可比对于对的回答二者的预测都是全对对于错的回答二者的预测都是存在有错误的步骤只不过PRM会进一步给出错误的具体位置。效果效果上论文使用Best-of-N的Major Voting作为基准来对比PRM和ORM筛选答案的正确率如下图随着采样答案N的数量增加PRM相比ORM和Major-Voting的相对优势会越来越显著。考虑以上ORM和PRM训练数据集并不相同不算严格的对比实验之后论文还做了相对可比的消融实验这里不再赘述。除了直观的效果对比PRM相比ORM还有几个对齐优势redit Assignment针对复杂问题PRM能提供错误具体产生的位置使得进一步的迭代修改变得更加容易因此PRM的奖励打分的边际价值更高SaferPRM针对COT的过程进行对齐相比只对齐结果可能存在过程错误的一致性更高个人感觉是reward hacking的概率会相对更低因为对齐的颗粒度更细negative Alignment Tax: 论文发现PRM似乎不存在对齐带来的效果下降甚至还有效果提升。青出于蓝weak-to-strongWEAK-TO-STRONG GENERALIZATION: ELICITING STRONG CAPABILITIES WITH WEAK SUPERVISIONhttps://github.com/openai/weak-to-strongweak-to-strong是openAI对齐团队在23年年终交出的答卷。论文的本质是对超级对齐问题进行一个简化的讨论也就是当大模型的能力越来越强甚至超越人类的时候人类的监督是否还能有效指导模型行为保证模型的安全性和指令遵从性。以及这种弱监督该如何进行所以超级对齐本质是一个“弱-监督-强”的问题而论文进行的简化就是把人类监督超级模型的问题类比简化成一个弱模型监督强模型的过程即所谓“Weak-to-Strong Generalization”论文的思路其实和前几年曾经火过的弱监督半监督带噪学习的思路非常相似。就是在任务标签上训练弱模型然后使用训练后的弱模型进行打标再使用模型打标的标签来训练强模型看强模型的效果能否超越弱模型。逻辑上弱监督半监督其实是提高模型在unseen样本上的泛化能力而OpenAI这里研究的Weak-to-Strong更多是模型能的泛化。论文可以分成两个部分使用常规微调测试weak-to-strong的泛化效果以及探索如何提升weak-to-strong的泛化下面我们来分别说下Experiment首先论文选择了三种任务类型来测试模型泛化效果NLP分类任务 22个包括NLI分类CRSA在内的NLP分类任务。这类任务可能大小模型表现都不错模型越大效果会有提升但不明显Chees Puzzles象棋挑战预测下一步最佳下法的。这类任务可能有比较明显的模型规模效应小模型做不了得模型大到一定程度后效果会越来越好ChatGPT Reward Model: 预测pair-wise的人类更偏好的模型回答。这类任务现在没啥模型效果好大的小的都一般其次就是在以上数据集上分别进行以下训练weak supervisor使用以上数据训练小模型得到Teacher模型Weak-to-strong使用以上弱模型在held-out数据集上预测得到label并使用这些弱监督的标签来训练一个更大更强的模型strong ceiling使用以上任务的样本直接训练强模型得到模型能力上限以上得到的三个模型效果理论上应该是weak-supervisor weak-to-strong strong-ceiling最后论文通过计算弱监督训练帮助强模型恢复的能力占比来衡量weak-to-strong监督的泛化效果既Performance-Gap-Recovered(PGR)以下为直接微调的实验结果下图分别展示了不同模型大小的strong student横轴weak teacher颜色在以上三个任务上的任务准确率和对应的PGR用来衡量weak-to-strong的泛化效果。NLP任务最小的Teacher训练大许多倍的Student也能恢复20%以上的能力随Teacher和Student的大小增大PGR都会有提升Chess Puzzle任务上当Teacher模型较小的时候Student几乎学不到任何信息。而随着Teacher变大PGR会有显著提升但是随着Student变大任务准确率和PGR反而会有下降。可能存在inverse scalingChatGPT Reward任务上随着Teacher增大Student的任务准确率会有提升但泛化PGR几乎都不会超过20%。这里三种任务的泛化差异其实和前面提到的三种任务本身难度以及和模型大小的相关性有关。如果从噪声学习的角度来讨论的话NLP任务和模型大小相关性低且标签噪声较小Chess Puzzle和单模型大小以及stduent-teacher之间的gap相关性都很大teacher标签噪声以及student-teacher预测的一致性都随模型scale变化reward任务都很一般和模型大小没啥关系。整体上通过直接微调能稳定获得一定的能力泛化PGR0)但泛化效果并不好。于是下面论文讨论了能否通过改变训练方案来提高weak-to-strong的泛化效果。Improvement方案一Bootstraping采用渐进训练的方案也就是我们可以先用小模型对齐略大一些的模型再用略大一些的模型来对齐更大一些的模型然后逐步迭代下去。这种训练方式可能更适合上面Chess Puzzle的任务考虑该任务存在Inverse Scaling既当Student比Teacher大的越多weak-to-strong的泛化效果越差那我们可以逐步放大Student模型的大小保持Teacher和Student之间的gap不要太大。效果上不难发现对比以上的inverse scaling的PGR变化在相同的Teacher模型上我们可以获得几乎持平的PGR泛化效果也就意味着更小的模型可以帮助更大的模型恢复相同比例但绝对值更大 的能力。这里论文统一采用了3次迭代也就是会训练两个中间大小的模型。方案二Regularization如果我们想让大模型学习的时候只学习小模型在任务上获得的Insight而不是简单的去模仿小模型可以通过加入正则项的方法。用的是半监督学习里面的最小熵原则和Pseudo Label的损失函数是近似的。也就是在原始的交叉熵左的基础上加上了student模型的预测熵值这里f(x)是训练中的大模型而t是一个动态阈值是batch内样本预测概率的中位数这样大模型即便不去学习Teacher模型通过提高自己对预测样本的置信度自信一点你是对的也可以降低损失函数。\[Lconf(f) (1 − α) · CE(f(x), fw(x)) α · CE(f(x), \hat{f}_t(x)) \]以上损失函数还可以改写为噪声损失函数中的Bootstrap Loss。也就是Student学习的label是由Teacher的预测label和student模型自己预测的label混合得到的。逻辑也是一样如果这个问题你对自己的预测很自信那请继续自信下去\[Lconf(f) CE(f(x), (1 − α) · fw(x) α · \hat{f}_t(x)) \]以上正则项的加入在NLP任务上当student和teacher之间的gap较大时能显著提高weak-to-strong的泛化效果即便最小的Teacher也能恢复近80%的大模型效果说明降低student无脑模仿teacher的概率是很有效的一种学习策略。Why Generalization最后论文讨论了为何存在weak-to-strong泛化以及在什么场景下存在。这是一个很大的问题论文不可能穷尽所有的场景因此有针对性的讨论了模仿行为和student模型本身对该任务是否擅长。这里简单说下主要的结论吧Imitation这里论文分别通过过拟合程度以及student和teacher的预测一致性来衡量大模型是否无脑拟合了teacher模型。并提出了合适的正则项以及early stopping机制可以降低模仿提高泛化Sailency论文提出当强模型本身通过预训练对该任务已经有很好的任务学习表征的情况下泛化会更好。这里个人感觉有些像DAPTTAPTdomain/taskadaptive pretraining的思路。从文本表征空间分布的角度来说就是当模型对该任务文本所在空间分布本身表征更加高维线性可分边界更加清晰平滑时模型更容易泛化到该任务上。最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。四、AI大模型商业化落地方案五、面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表