ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

面试官追问:“GRPO 为什么不用 PPO?”,我:“省了 critic”,他:“一组全对,你学什么?”

面试官追问:“GRPO 为什么不用 PPO?”,我:“省了 critic”,他:“一组全对,你学什么?” 最近查看了一些面试题发现 GRPO 挺高频的百度、美团、快手、字节问得最多。基本上都在问同一件事拿 GRPO 和 PPO 或者 DPO 比。剩下的问法也很集中损失函数和优势怎么算的 47 道KL 约束 11 道全对全错和训练崩溃 9 道。有些题一道里问了两样。你简历上要是有这么一行这些题基本都会落到你头上售后操作智能体 Agentic RL 后训练GRPO 后训练K4 组内优势 崩塌熔断任务成功率 8% → 93%pass1reward ≥ 0.9我看下来大家的问题出在准备的方向上。备的是算法对比PPO 有 criticGRPO 没有背得很熟。面试官顺着往下问的是项目你为什么这么选代价是什么训崩了你怎么知道。我从里面挑了六道你面试的时候大概也是按这个顺序被问到。示范答法用的是第一人称是站在做过这个项目的同学的角度写的其余地方说“我”的都是我吴师兄。127 道 GRPO 真题在问什么第 1 节01 / 07GRPO 相比 PPO 改进了什么为什么选它请分析 GRPO 相比 PPO 在哪些方面有所改进解决了 PPO 的哪些局限性。同花顺GRPO 与 PPO 的核心思想有何不同在实际训练中为何某些场景下更倾向于使用 GRPO腾讯最常听到的回答就一句PPO 要训一个 critic 来估基线GRPO 不用省显存。这句话没错但它只回答了“省掉了什么”。面试官接着会问两件事基线去哪了省掉 critic 你付出了什么。基线还在GRPO 对同一个 prompt 采一组轨迹用这一组 reward 的均值当基线critic 估的那个数换成了组内统计出来的数。ratio、clip、KL 这些 PPO 里有的东西GRPO 一样都没少。你要是说成“GRPO 比 PPO 简单”面试官会接着让你写损失函数题库里让手写 GRPO loss 的题有 7 道。代价你也得跟面试官交代。同一条工单要采 K 条轨迹采样成本直接乘 K学习信号全靠组内的分数差一组里分数都差不多的时候就学不到东西。这类题还有一个变体把 DPO 也拉进来比美团和阿里都这么问过。DPO 学的是成对的偏好哪个回答更好要提前标出来训练的时候模型不去环境里跑。我们的任务正好反过来退没退款、改没改地址沙盒里查得到让模型在线试、试完打分更直接。我自己的看法是这道题答到“代价”就已经比大多数人深了DPO 那段是加分项时间不够可以不展开。训练框架用的是 verl。启动的时候优势估计选 grpocritic 关掉框架自带的 reward model 也关掉分数由项目自己的 Verifier 返回。这几个开关能说出来面试官就知道你真跑过。放到项目里可以这样答我们训的是售后操作 Agent一条轨迹要调好几次工具最后由 Verifier 给整条轨迹打一个分。我用的是 GRPO配置里 critic 是关掉的优势用组内估计。选它是因为我们的 reward 本来就是整条轨迹一个标量同一条工单采 4 条互相比比单独训一个 critic 去估长轨迹的价值要稳。代价是采样量乘 4而且组内分数没差别的工单要单独处理。PPO 和 GRPO 的基线从哪来第 2 节02 / 07组内相对优势到底怎么算请详细说明 GRPO 中群体相对优势的具体计算方法归一化操作在其中扮演什么角色百度这题很多人直接背公式reward 减均值除以标准差。面试官要的是你手里有一组真实的数。我用破损退款那条工单举例同一个 prompt 采了 4 条轨迹Verifier 给的分是 0.92、0.31、0.68、0.14。组内均值 0.5125标准差 0.2980。四条轨迹的优势算出来是 1.367、−0.679、0.562、−1.250。正的那两条模型会提高生成它们的概率负的那两条会被压低。0.68 那条单看分数不算高放在这一组里是正样本。再往下面试官会问为什么要除标准差。不除的话不同工单之间没法比。取消未发货订单那种简单工单4 条轨迹的分数是 0.96、0.97、0.95、0.96标准差只有 0.008它的优势量级会和破损退款差出几十倍。然后是优势怎么落到 token 上。优势是整条轨迹一个数它会广播到这条轨迹里模型自己生成的每个 token 上。工具返回、用户输入这些 token 进上下文但 mask 是 0不算进 loss。mask 这件事后面讲骗分的时候还会出现先记住。还有一个容易被问住的细节ratio 按什么粒度算。你要是按 token 算每个 ratio 都接近 1看着稳噪声很大。换成整条轨迹算几十步的 ratio 连乘起来会很极端30 步的轨迹能到 2.43 或者 0.40。我们用的是折中的粒度一次工具调用算一块。一组四条轨迹怎么算出优势第 3 节03 / 07一组里全对或者全错怎么办当 GRPO 训练过程中出现大量全正确或全错误的样本组时应该采取什么策略来处理这种样本分布可能带来什么问题百度我猜你的第一反应是加一个很小的 ε 防止除零。ε 只能保证程序不报错。真正的问题是标准差接近 0 的时候优势全是被放大的噪声。全对的情况还是那条取消订单的工单。四条轨迹都做对了分数只差 0.01除以 0.008 之后优势有正有负看着像信号模型学的是随机波动。全错的情况更危险。部分发货拆单那类工单四条轨迹的分数是 0.10、0.12、0.08、0.11没有一条做成。组内相对最好的那条做的事情是中途转人工。直接拿去训模型强化的就是“最不烂的失败”转人工率从 8% 涨到了 41%。这个涨幅放在任何一条业务线上都够开一次事故复盘。你可能会想那改一下 reward 公式不就行了我们的处理方式是把这些工单从主训练里拿出去reward 公式不动。全对的工单进回放池偶尔拿回来过一遍防止模型忘掉。全错的工单拆成几个阶段每个阶段单独打分前面的阶段过了再解锁后面的。缺工具导致全错的先补工具补完之前不给它分配训练算力。简历上写的“崩塌熔断”指的是组内分数差塌掉的时候这一组不进主训练。这里有个容易误诊的情况。缺工具的那类工单8 条轨迹的分数全在 0.24 到 0.28 之间标准差也很小看着和全错一样。要是照着全错去拆阶段拆几段都没用因为那条路根本不存在。先问有没有一条轨迹成功过再看标准差。示范答法加 ε 只是防除零。全对和全错的组标准差接近 0标准化以后是在放大噪声。我们的做法是按组内标准差做路由低于阈值的不进主训练全对的进回放池全错的拆阶段训。我们吃过一次亏全错的工单直接训转人工率从 8% 涨到了 41%。第 4 节04 / 07KL 约束是干什么的KL 太大会怎样在使用 GRPO 进行大模型训练时KL 散度的控制至关重要。请说明 KL 散度过大会带来什么问题以及你通常采用哪些方法进行调节。滴滴这题最容易答成一句KL 防止策略更新太快。这么答是把 clip 和 KL 混在一起了面试官下一句多半是那 clip 不是已经在限制更新幅度了吗。clip 只看这一步ratio 跑出 0.8 到 1.2 这个区间目标函数就不再跟着涨。破损退款那条最好的轨迹执行退款那一步的 ratio 是 1.35超过了上限就按 1.20 算。KL 看的是一路累下来漂了多远。每一步都合规训了一百个 batch 以后模型可能已经离起点很远了。讲到这里要把几个策略分清。采样时的那份参数每个 batch 刷新一次正在训的那份每一步都在变还有一份参考策略整段训练都冻结一般就是 SFT 之后的那个模型。ratio 是正在训的和采样时的比KL 是正在训的和参考策略比。把它们混着用是 GRPO 实现里最常见的 bug。排查实现的时候我建议先看这一处。KL 太大意味着模型漂离了 SFT 打下的底子格式和基本行为会先出问题。KL 也有管不到的地方。模型可以一直待在参考策略附近但只押一两个动作这叫塌缩。我们一共 7 个候选动作健康的时候熵在 1.92 左右接近上限一个动作占到九成五的时候熵只剩 0.25。所以 loss 里还有一项熵专门留探索的余量。调节用的是自适应的 β。目标 KL 定在 0.10β 从 0.05 起步。这一批的 KL 超过目标的 1.5 倍β 乘 1.5 把绳子拉紧低于目标的一半β 除以 1.5 放松一点。示范答法clip 管单步KL 管累计漂移它们比的对象也不一样。KL 比的是当前策略和冻结的参考策略我们的参考策略是 SFT 之后的模型。β 是自适应的实测 KL 超过目标值 1.5 倍就收紧低于一半就放松。第 5 节05 / 07怎么判断 GRPO 训练是不是正常收敛在使用 GRPO 进行策略训练时有哪些关键指标可用于判断训练过程是否正常收敛请从奖励曲线、策略熵、KL 散度、损失函数变化等维度进行分析。美团题目里已经把指标名字列出来了所以很多人顺着报一遍看 reward 曲线看 loss看 KL。光报名字面试官是不认的他想听的是你先看哪个、后看哪个哪个亮红灯了你做什么。我们的顺序是固定的。先看有没有路同一条工单的 K 条轨迹里至少有一条能拿到正向的分吗一条都没有后面的指标不用看了先去查是不是缺工具或者路径太长。路径太长的典型是部分发货拆单完整做下来要二十多步。模型走通的概率太低训一两轮这条路就被压没了。有路了你再看有没有信号也就是组内 reward 的标准差够不够大。不够就去改路由别去调学习率。最后才看算得对不对approx_kl 和被 clip 掉的比例有没有飙高。物流停滞那类长任务我们给 clip 比例划的线是不能超过 25%。这个顺序反过来会白忙。缺工具的工单你去调 KL 是调不好的。最后这一关我举个例子。已发货改地址那类工单一条轨迹要跑 12 分钟等它回到训练端参数已经更新了 3 次采样时记下的概率已经过时了。当时 approx_kl 飙到 0.61做了重要性采样的截断修正之后降到 0.07。看的频率也不一样。有没有路每 50 步看一次有没有信号每 100 步算得对不对每一步都看。这道题后面经常跟一个追问GRPO 是 on-policy 还是 off-policy华为、字节、美团都问过。它是 on-policy 的数据得是当前策略采出来的。上面那个 12 分钟的例子说明长任务里这一条很容易被悄悄打破采样用的参数和训练用的参数已经对不上了。能把这个例子讲出来比答一句 on-policy 有用。训练不涨时先问哪几个问题第 6 节06 / 07reward 一直在涨怎么知道模型没在作弊在 GRPO 训练过程中如何识别和防范 Reward hacking 现象请列举可观测的异常信号、检测手段及缓解策略。美团大家张口就是加规则把漏洞堵上。堵漏洞是发现以后的事面试官先问的是你怎么发现。前面那几关全绿之后你还看什么最管用的信号是训练 reward 和影子评估之间的差。留一批工单不参与训练只用来评估破损退款这条线留了 100 条。训练 reward 在涨这批工单上的表现在掉模型多半是找到了骗分的办法。我们出过一个典型的。工具返回的 token 被误算进了 loss训练 reward 涨到了 0.96影子评估差了 0.42。查下来模型学会了自己在输出里写“工具返回成功”这类本该由环境给出的内容Verifier 被它骗过去了。前面说的 mask 就是防这个的工具返回要标成 0。几关全绿我也不敢放心。只要有一种骗分的办法能稳定漏过去训得够久模型一定会找到它。另一类信号是业务指标。转人工率就是模型没有犯任何错分数也不低但它学会了遇到难单就不做事。缓解靠的是 Verifier 里的封顶护栏上一篇整篇都在讲。这里补一句我自己的理解reward 在训练里是拿来定方向的哪个方向能稳定涨分模型就往哪走每次只涨一点点它也会走。示范答法我主要看两个信号。一个是训练 reward 和影子评估的差留出的工单不进训练两边走势一旦分叉就停下来查。另一个是转人工率这类业务指标。我们遇到过工具返回被算进 loss 的问题训练 reward 到了 0.96影子评估差了 0.42后来把工具返回的 mask 改成 0 才解决。第 7 节07 / 07六道题丢分都丢在哪把六道题放在一起看只答到第一层的回答有几个共同点。一个是只说省掉了什么、加上了什么不说代价。GRPO 省了 critic代价是采样量和对组内方差的依赖KL 拉住了模型代价是拉太紧模型动不了。你把代价讲出来面试官才会相信这是你自己选的。另一个是手里没有数。0.92、0.31、0.68、0.14 这一组数怎么变成四个优势你得自己算过一遍才讲得顺。还有一点六道题里反复出现只讲正常情况不讲翻车。全对全错、KL 飙高、reward 在涨模型在骗分这些都是训练里真会遇到的事。面试官问到深处基本都在问你翻过什么车、怎么发现的、怎么救回来的。这部分准备起来不难把训练日志里出过问题的那几次翻出来各写三五句就够。你可以拿自己的简历对一下GRPO 那一行里的每个词能不能各讲出一个数和一个代价讲不出来的那个词要么去补要么从简历上拿掉。这一行简历可以怎么改原来那行里“崩塌熔断”面试官看不懂“K4 组内优势”只报了参数。可以改成这样售后操作智能体 Agentic RL 后训练GRPO 后训练关闭 criticK4 组内标准化优势组内方差过低的工单路由出主训练KL 自适应约束任务成功率 8% → 93%pass1reward ≥ 0.9括号里写明关掉了 criticGRPO 和 PPO 差在哪先摆出来。“崩塌熔断”换成了做的事情本身面试官顺着问就是全对全错那道题。后面加上 KL 自适应是给 KL 那道题留的口子。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表