ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

PRUNE-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning——面向长时程推理的高效可靠同策略

PRUNE-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning——面向长时程推理的高效可靠同策略 论文提出PRUNE-OPD一个面向长时程推理的高效、可靠同策略蒸馏On-Policy Distillation, OPD框架。其核心研究内容可以概括为以下几个方面一、研究问题长时程 OPD 中的“前缀漂移”与奖励不可靠OPD 通过让学生在当前策略生成的轨迹上接受教师的密集 token 级奖励来提升推理能力。但在长时程推理中学生的生成前缀会逐渐偏离教师的思维过程导致教师给出的密集奖励在“漂移”前缀上失去局部可利用性继续在这些不可靠轨迹上生成和评分 token既降低奖励质量又浪费大量计算固定 rollout 预算面临两难太短会丢弃有用长推理太长则把算力浪费在不可靠后缀上。因此论文将长时程 OPD 重新定义为可靠性分配问题不是简单增加或减少密集奖励而是判断哪些位置上的教师监督仍然可靠、值得训练。二、方法PRUNE-OPD 的三大机制PRUNE-OPD 被设计为 OPD 的即插即用修正器不改变教师奖励的计算方式只调整每个位置对奖励的信任程度。逐位置兼容性指标在相同的学生前缀下比较学生与教师的 top-kk 候选 token 集合用重叠率衡量局部兼容性当重叠率低于阈值 γγ 时记录一次前缀漂移事件。还提供更严格的top-pp 动作接受度变体。累积可靠性权重与奖励衰减将漂移事件沿回复累积用截断线性衰减生成单调非增的可靠性权重对后续 OPD 奖励进行缩放并加入基础权重 wbasewbase​避免变成硬开关。动态回复预算控制器根据“有效可靠长度”的批次命中率动态扩展或收缩 rollout 最大长度当可靠性高时保留长上下文监督当可靠性低时提前截断把计算重新分配到可靠前缀。三、实验设计多教师-学生组合验证论文在DAPO-Math-17K上训练评估五个教师-学生对覆盖不同兼容性场景DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5BDeepSeek-R1-Distill-Qwen-1.5B / DeepSeek-R1-Distill-Qwen-7BQwen3-1.7B-Base / Qwen3-4B非思考Qwen3-4B-Base / Qwen3-4B非思考DeepSeek-R1-Distill-Qwen-7B / Skywork-OR1-7B高兼容性评估基准包括AMC23、AIME24、AIME25、HMMT24、HMMT25主要指标为 pass1 准确率和相对训练时间减少。四、主要实验结果低兼容性场景大幅节省训练时间性能基本保持甚至提升重叠率版 PRUNE-OPD 在低兼容性运行中减少训练时间37.6%–68.0%下游准确率与 OPD 基线接近部分 AIME/HMMT 分数还有提升在 Qwen3 低重叠对上PRUNE-OPD 同时提升效率和准确率因为它抑制了不可靠后缀梯度对更新的主导。高兼容性场景不盲目缩短保留长上下文监督当学生-教师重叠率很高时动态控制器将训练窗口扩展到 12288 token训练时间和准确率与 OPD 几乎不变说明 PRUNE-OPD 是自适应可靠性控制器而非固定长度惩罚。优于固定截断和随机剪枝固定 4K 截断在部分组合中会损害性能因为它无法区分“漂移后缀”和“仍然兼容的长推理”重叠率指标通常优于 top-p 接受度因为后者对推理轨迹可能过于严格。消融与诊断阈值 γ0.7 提供了较好的性能保护与效率平衡训练动力学显示 PRUNE-OPD 与 OPD 学习轨迹一致节省主要来自后缀奖励衰减和动态长度控制深度分析表明兼容性随轨迹深度下降越往后教师监督越不可靠。五、结论与意义论文的核心结论是高效的长时程 OPD 不应由教师强度或固定 rollout 预算单独决定而应根据教师监督在学生实际访问前缀上的局部可利用性来分配密集监督。PRUNE-OPD 通过在线监测学生-教师兼容性将累积前缀漂移转化为奖励衰减和动态 rollout 控制在低兼容性时显著降低训练成本在高兼容性时保留长上下文监督从而实现了可靠性预算化的 OPD。六、局限与未来工作依赖 top-kk 局部分布统计可能遗漏候选 token 相同但排序差异大的情况线性衰减假设局部兼容性与奖励可利用性相关但低重叠前缀之后可能回到兼容状态目前仅缩放 OPD 奖励未对零可靠性 token 接入 GRPO 回退实验限于数学推理未来可扩展到智能体和多轮场景未来可将 PRUNE-OPD 与 GRPO 结合形成可靠性门控的混合目标。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要同策略蒸馏On-policy distillation, OPD利用密集的教师奖励来增强推理模型。然而将 OPD 扩展到长时程任务时暴露出一个关键缺陷随着学生生成的前缀不可避免地偏离教师的思维过程教师的密集奖励失去了局部可利用性。在这些“漂移”轨迹上继续生成和评估 token 不仅会降低奖励质量还会造成大量计算浪费。为解决这一问题我们提出了 Prune-OPD一个将训练预算与监督质量动态对齐的框架。通过持续监控学生与教师预测之间的局部兼容性例如通过 top-kk 重叠度Prune-OPD 实时检测前缀漂移事件。一旦检测到严重漂移它便单调地降低后续不可靠奖励的权重并触发动态 rollout 截断。这使得训练过程能够停止无效生成并将计算重新分配到可靠的教师监督上。在多种教师-学生组合中Prune-OPD 始终将计算与监督可靠性对齐。当前缀漂移导致密集教师奖励不可靠时它将训练时间减少 37.6%−68.0%同时在具有挑战性的基准AMC、AIME、HMMT上保持甚至提升性能。当学生-教师兼容性保持较高时它通过扩展训练窗口自动保留长上下文监督。这些结果表明Prune-OPD 改进 OPD 的方式并非盲目缩短 rollout而是将计算重新分配到局部可利用的教师奖励上。1 引言同策略蒸馏OPD已成为大型语言模型后训练的核心技术。近期如 Qwen3 [36]、MiMo [34] 和 GLM-5 [45] 等系统在后训练流程中采用了 OPD 风格的密集监督。Thinking Machines Lab [24] 报告称OPD 方案能够以显著低于结果奖励强化学习的计算量复现强大的推理增益。这使得 OPD 成为监督微调和可验证强化学习的有吸引力的补充它在长推理轨迹上提供 token 级学习信号而不是等待稀疏的最终答案奖励。OPD 的吸引力在于其同策略特性。离策略蒸馏在固定的教师生成序列上训练学生这会导致暴露偏差问题在推理时学生必须在并非由教师或参考策略产生的前缀下行动 [2]。OPD 则从当前学生采样 rollout并在相同的、学生访问过的前缀上评估教师。这一设计也激发了近期的自蒸馏方法其中模型在特权信息或反馈下充当自己的教师并从自身的同策略经验中改进 [14, 47, 30]。在长时程数学推理中这一区别至关重要单个解答可能包含数千个 token因此即使很小的训练-推理不匹配也会在轨迹中累积。图 1PRUNE-OPD 概念概览。PRUNE-OPD 沿学生 rollout 监控局部学生-教师兼容性在低重叠漂移事件后单调衰减 OPD 奖励并在可靠教师监督耗尽时截断回复。然而同样的同策略设计带来了新的可靠性问题。教师不仅在那些其局部分布能提供有用纠正的前缀上被查询也在那些已经偏离教师推理过程的前缀上被查询。近期的 OPD 动力学分析指出OPD 的成功取决于局部思维模式兼容性且奖励质量可能随轨迹深度而恶化 [22]。我们将这一诊断作为设计约束长时程 OPD 不应将每个生成的 token 视为同等值得监督。缺失的一环是在线可靠性控制。当前的 OPD 方案通常在生成前选择 rollout 预算然后沿采样回复均匀地应用密集教师奖励。这造成了一个糟糕的权衡。较短的固定预算可能丢弃有用的长推理而较长的固定预算则花费大量计算生成和评分那些教师信号可能不再具有局部可利用性的后缀。在实践中单个 rollout 可能同时包含两种状态早期前缀中学生和教师仍共享合理的下一 token 支持随后是学生已做出教师不会选择的推理决策的后缀。因此OPD 所需的不是简单增加或减少密集奖励而是一种判断密集奖励在何处足够可靠以用于训练的方法。我们提出了 PRUNE-OPD一种面向长时程 OPD 的可靠性感知修正器在训练过程中做出这一决策。PRUNE-OPD 不是过滤整个回复或施加固定回复长度而是提出一个位置级问题在相同的学生前缀下学生和教师是否仍然共享高概率候选区域主要信号是逐位置 top-k 重叠率教师 top-p/top-k 动作接受度作为更严格的变体。当所选兼容性指标低于其阈值时PRUNE-OPD 记录一次前缀漂移事件。累积的漂移事件定义了一个单调的可靠性权重用于衰减后续 OPD 奖励而相同的原始可靠性信号定义了动态 rollout 控制的有效回复长度。预期的转变是从固定预算 OPD 转向可靠性预算 OPD密集监督应分配到教师在学生轨迹上仍可操作的位置。我们进行了大量实验以评估可靠性感知剪枝在实践中是否改进了长时程 OPD。结果验证了 PRUNE-OPD 的有效性当密集监督变得不可靠时它将训练时间减少 37.6%−68.0%同时保持或提升下游准确率。额外的运行表明当可靠性信号保持较高时控制器会保留长上下文监督支持了 PRUNE-OPD 是重新分配计算而非盲目缩短 rollout 的主张。总之我们的贡献如下我们将长时程 OPD 形式化为学生访问前缀上的可靠性分配问题将轨迹深度退化与局部兼容性和奖励可利用性联系起来。我们提出了 PRUNE-OPD它将累积前缀漂移转化为单调的 OPD 奖励衰减和动态回复长度控制器且在禁用时不改变基线 OPD 路径。我们提供了初步证据表明当前缀漂移限制了可靠监督时可靠性感知剪枝可将 OPD 训练时间减少 37.6%−68.0%同时保持基准性能我们指定了固定长度剪枝对照以检验增益是来自可靠性还是单纯的缩短。2 背景与问题设定2.1 同策略蒸馏2.2 动态指标2.3 长时程可靠性问题位置 t 的奖励取决于 qt(v)πT(v∣x,yt)其中前缀 yt由学生生成。随着 t 增大前缀可能偏离教师自然生成的轨迹。先前的 OPD 分析报告了后缀到前缀的不稳定性以及随着学生前缀深度增加教师延续优势递减 [22]。因此同样的密集奖励在中等长度轨迹上有帮助在长轨迹上可能变得不可靠。这促使了位置级可靠性控制。我们估计每个学生前缀是否仍与教师兼容然后将密集监督分配给可靠前缀并在前缀漂移后衰减奖励。3 PRUNE-OPDPRUNE-OPD 将局部学生-教师兼容性转化为 OPD 奖励上的逐位置权重。该方法被设计为 OPD 的即插即用修正器它不改变教师奖励的计算方式而是改变每个访问位置应多大程度信任该奖励。它包含三个部分逐位置兼容性指标、累积可靠性权重以及可选的动态回复长度控制器。3.1 兼容性指标该指标直接遵循 OPD 机制分析成功的 OPD 与高概率重叠增加相关而失败的运行在学生访问状态上显示重叠停滞或不稳定 [22]。它衡量学生和教师是否仍共享合理的局部动作空间。低重叠意味着教师的密集奖励是在其偏好下一 token 支持已与学生支持分离的区域中计算的。我们还设计了一种替代的 top-p 动作接受度指标其定义见附录 A.10。3.2 累积可靠性与损失加权坏事件在回复上累积3.3 动态回复预算PRUNE-OPD 还可以在训练期间调整 rollout 长度。定义样本的有效回复长度为4 实验我们评估可靠性感知奖励缩放能否在保持下游推理准确率的同时大幅降低 OPD 训练成本。除最终基准准确率和训练时间外我们还测量学生访问状态上的局部学生-教师动力学包括重叠率、top-p 接受度和有效可靠长度。4.1 实验设置训练数据。我们在 DAPO-Math-17K [44] 上训练遵循近期推理实验使用的 OPD 设置。训练提示在每次运行前打乱。主要 RL 结果奖励是最终答案正确性。然而OPD 提供密集的 token 级蒸馏奖励。模型。我们评估五个教师-学生对以测试不同 OPD 动力学下的可靠性信号。DeepSeek-R1-Distill-Qwen-1.5B 从 DeepSeek-R1-Distill-Qwen-7B 蒸馏后者是一个更大的同系列推理模型其更高的基准分数可能并不意味着局部可利用的 token 级反馈 [10]。同一学生也从 JustRL-DeepSeek-1.5B 蒸馏后者是从 DeepSeek-R1-Distill-Qwen-1.5B 获得的同尺寸 RL 改进教师 [11]。Qwen3-1.7B-Base 和 Qwen3-4B-Base 从 Qwen3-4B非思考模式蒸馏隔离同一模型系列内思考模式转变与学生规模的交互 [36]。最后DeepSeek-R1-Distill-Qwen-7B 从 Skywork-OR1-7B 蒸馏提供了一个高初始重叠设置其中 PRUNE-OPD 预期会保留长上下文监督而非缩短 rollout。这些组合共同在不同条件下测试同一主张当可靠性衰减时控制器减少计算而当兼容性保持较高时保留密集监督。4.2 主要结果主要结果是一致效率增益且下游准确率没有明显退化。在主要低兼容性运行中重叠率变体将训练时间减少 35.7%、68.0%、37.6% 和 52.6%同时基准准确率与相应 OPD 基线保持接近。各基准之间的准确率差异好坏参半应作为次要指标解读PRUNE-OPD 略微提升了若干 AIME/HMMT 分数但也降低了一些条目例如 DeepSeek-R1-Distill-Qwen-7B 教师下的 AIME24 和 JustRL-DeepSeek-1.5B 教师下的 HMMT24。这一模式与 PRUNE-OPD 作为可靠性感知效率机制而非独立准确率改进方法的角色一致。top-p 动作接受度变体通常更保守且往往弱于重叠率表 1PRUNE-OPD 主要结果。准确率以百分比报告。时间减少相对于相同学生-教师对下的基线 OPD。图 24 个 DeepSeek 学生-教师对的准确率随墙钟时间变化。每个面板以墙钟时间为 x 轴、基准准确率为 y 轴比较 OPD 和 PRUNE-OPD。成功的曲线应在达到可比检查点时匹配或超过 OPD 准确率但时间更早。表明精确的采样 token 可接受性对推理轨迹可能过于严格而候选空间重叠更好地捕捉了教师是否仍提供可利用的局部监督。4.3 高兼容性下的自适应行为此设置检验 PRUNE-OPD 是否均匀缩短每次运行。当教师和学生具有高 top-k 重叠时有效长度命中率很快满足动态控制器将训练窗口打开到 12288 token。由此产生的训练时间和准确率与 OPD 几乎不变。图 3 应从三个视角展示相应机制重叠率保持高位动态回复预算跟踪长可靠上下文而非强制提前截断AMC23 学习曲线比较 PRUNE-OPD 是否在避免固定截断刚性的同时匹配 OPD 级准确率。这支持了预期解释PRUNE-OPD 是自适应可靠性控制器而非硬长度惩罚。4.4 训练动力学图 4 检验 PRUNE-OPD 是否改变学习动力学还是仅仅移除 rollout 计算。对于 JustRL-DeepSeek-1.5B 教师各基准的步进准确率曲线应显示 PRUNE-OPD 在 AMC23、AIME24、AIME25、HMMT24 和 HMMT25 上遵循与 OPD 相同的学习轨迹而不是通过牺牲准确率来加速。图 5 解释了节省的计算来自何处逐位置权重图应显示累积前缀漂移后的后缀奖励衰减有效长度图应显示动态最大 OPD 长度适应可靠监督窗口重叠率曲线应确认剪枝由测量的局部兼容性信号驱动。表 2高兼容性行为。DeepSeek-R1-Distill-Qwen-7B 和 Skywork-OR1-7B 的初始重叠率约为 0.94。图 3DeepSeek-R1-Distill-Qwen-7B / Skywork-OR1-7B 的高兼容性训练动力学。左有效回复长度和最大 OPD 长度随训练步数变化。中重叠率随训练步数变化。右AMC23 准确率随训练变化比较 OPD、OPD截断 4k和 PRUNE-OPD。4.5 墙钟效率图 2 在墙钟轴上评估核心效率主张PRUNE-OPD 应减少经过的训练时间而不降低准确率某些情况下还可略微提升。如果 PRUNE-OPD 按预期工作其曲线应在可比准确率水平上位于 OPD 左侧或在相同墙钟时间下位于 OPD 上方。这一展示直接检验 PRUNE-OPD 是否在两个 DeepSeek 教师-学生组合中以更少经过训练时间达到 OPD 级甚至偶尔更好的准确率。结合图 4 和图 5 的动力学这些结果表明可靠性感知后缀降权缩短了无生产力的 rollout 计算同时保留了驱动最终性能的有用前缀监督。表 3DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B 上的重叠阈值消融。4.6 消融研究简单截断的 OPD。我们在表 1 和表 2 中纳入 OPD截断 4k作为固定预算基线。该基线使用相同 OPD 目标但均匀缩短每个 rollout而不观察学生-教师兼容性。尽管简单截断可以降低成本且对某些教师-学生对可能有效但它不能可靠替代 PRUNE-OPD。特别是对于 DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B 和 DeepSeek-R1-Distill-Qwen-7B / Skywork-OR1-7B固定 4K 预算截断会降低性能因为它丢弃了有用的长前缀监督。这一失败模式凸显了刚性长度规则的局限它无法区分漂移后缀和仍然兼容的长推理轨迹。剪枝指标重叠率 vs. top-p 接受度。指标消融报告在表 1 中。在已完成的运行中重叠率是更强的默认选择它比 top-p 接受度提供相等或更大的时间减少同时通常更好地保持准确率。我们将其归因于其支持集层面的性质它询问学生和教师是否仍共享高概率候选区域而不是要求采样的学生 token 落在教师可见的核内。这使得重叠率成为长推理轨迹更平滑的可靠性信号因为在长推理轨迹中多个局部合理的延续可能仍然有效。Prune-OPD 阈值消融。我们在表 3 中对 DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B 上的重叠率阈值进行消融。已完成的 γ0.7 设置给出了强操作点它保持 OPD 级基准性能同时将训练时间减少 35.7%。较低的阈值应更宽松产生更少坏事件和更长有效蒸馏长度较高的阈值应更早剪枝若设置过于激进可能移除有用的长推理。核心结论是 γ0.7 同时提供性能保护和显著训练效率提升。图 4DeepSeek-R1-Distill-Qwen-1.5B 从 JustRL-DeepSeek-1.5B 蒸馏的训练步准确率动力学。五个面板报告 AMC23、AIME24、AIME25、HMMT24 和 HMMT25 上随训练步数变化的基准准确率比较 OPD 和 PRUNE-OPD。图 5DeepSeek-R1-Distill-Qwen-1.5B 从 JustRL-DeepSeek-1.5B 蒸馏的训练动力学诊断。面板报告从第 0 到 200 训练步每 20 步的曲线按 token 位置的平均 Prune-OPD 权重训练中有效回复长度和最大 OPD 长度训练中重叠率。5 相关工作同策略蒸馏。MiniLLM 在反向 KL 目标下通过策略梯度优化为 LLM 形式化了 OPD强调反向 KL 的模式寻求行为 [9]。GKD 通过在多种散度下在同策略和离策略数据之间插值拓宽了这一视角 [1]。近期理论将 OPD 框架为密集 KL 约束 RL其中教师的逐 token 对数比可解释为隐式奖励甚至可以外推到教师标准强度之外 [38]。此后 OPD 出现在主要推理和后训练方案中 [36, 24, 45, 34, 20, 17, 15, 7, 38, 8]。它也被扩展到自蒸馏和在线经验学习其中模型在特权信息、反馈或样本路由下充当自己的教师 [14, 47, 12, 30, 43, 26, 18, 42, 37, 21, 46, 6, 31]。这些工作将 OPD 确立为强大的后训练原语。PRUNE-OPD 解决了一个互补的可靠性问题即使同策略下密集教师奖励可用长 rollout 也可能包含教师局部信号不再可利用的前缀。更多 OPD 讨论见附录 A.5。6 结论OPD 为长推理链提供密集监督然而当学生的推理模式偏离教师时所产生的密集奖励变得不可靠。PRUNE-OPD 将此视为逐位置可靠性问题它检查学生和教师在共享前缀下是否保持局部兼容将累积兼容性失败转化为漂移信号重新缩放 OPD 奖励并使用可靠而非原始 token 数控制回复长度。在多样蒸馏设置中基于重叠的 PRUNE-OPD 在低兼容性状态下将训练时间减少 37.6%−68.0%同时保持基准性能当兼容性保持高位时它保持长训练窗口开放。这些结果表明高效长时程 OPD 不应仅由教师强度或固定 rollout 预算支配。相反密集教师监督应根据其在学生实际访问前缀上的局部可利用性进行分配。
返回列表