Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration

Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
文章核心总结与翻译一、主要内容该研究聚焦于解决带可验证奖励的强化学习(RLVR)在大语言模型(LLM)训练中存在的计算开销大、数据效率低的问题——由于大量滚动路径(rollout)对优化贡献有限,导致训练成本高昂。研究提出了一种名为PREPO(Perplexity-Schedule with Relative-Entropy Policy Optimization)的方法,通过挖掘提示词(prompt)和滚动路径的内在属性,在不损失性能的前提下显著提升RLVR的数据效率。PREPO包含两个核心组件:困惑度调度(PPL-Schedule):以提示词困惑度(perplexity)作为模型适应性指标,训练过程从模型易理解的低困惑度提示词逐步过渡到高挑战性的高困惑度提示词,筛选出更具信息量的训练样本;相对熵加权(Relative-Entropy Weighting):通过计算滚动路径的序列级熵,放大不同滚动路径间的差异,优先强调不确定性高(高熵)的滚动路径,保留模型的探索能力。实验在Qwen(2.5系列、3系列)和Llama3.1等多个模型上验证,涉及数学推理基准(AIME24/25、MATH500、OlympiadBench等),结果显示PREPO可减少40%-66.7%的滚动路径使用量(最高达3倍减少),同时性能持平甚至超越全量数据训练的基线模型。二、创新点利用内在数据属性降低训练成本