ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

只复盘、不强化:4B 小模型靠「自我解释」追平 RL,训练时间省 63%

只复盘、不强化:4B 小模型靠「自我解释」追平 RL,训练时间省 63% 「讲一遍经历就能学会下次怎么做」——这个人类常识被这篇论文在 LLM 智能体上验证了效果惊人。方法简单到不像论文ROFTRetrospection-Only Fine-Tuning全流程只有四步智能体做一次任务 → 看到可得反馈 → 生成一段复盘解释 →只用这段解释的 token 做下一个词预测微调。没有外部老师、没有奖励模型、没有策略梯度——损失函数就是普通的语言模型损失训练目标是它自己写的复盘。作者刻意把方法做到极简就是为了隔离出一个问题的答案「解释自己的经历」这件事本身能不能改进后续行为结果4B 模型追平 GRPO还更快用 Qwen3.5-4B 在软件工程任务上实验- SWE-bench VerifiedROFT 49.2%20 次更新vs GRPO 48.0%40 次更新- SWE-bench ProROFT 26.8% vs GRPO 25.3%-训练时间省 63%同等 GPU 分配下 3.05 小时 vs 8.30 小时训练早期进度更快更反直觉的一条ROFT 能学会解决基础模型 64 次采样全部失败的任务——没有任何成功轨迹作为模仿对象学习从「解释失败」开始。这说明复盘不只是巩固已有能力它能产生新的解题路径。机制解释间接完成了信用分配RL 的核心难题是信用分配哪个动作导致了好结果。行为分析发现ROFT 通过语言模型损失间接实现了信用分配复盘里「这一步改对了方向」的表述让好动作的 token 概率上升「当时没看清需求」让坏动作的描述概率下降——语言建模天然编码了行为评价。还有个免费的礼物引导复盘「多讲直接解法」后后续尝试变短了——没有长度惩罚输出自然收敛与昨天聊的「信心训练让推理变短」异曲同工不直接优化的目标作为副产品出现。工程启示小团队练模型的新路径RL 训练管线奖励模型策略梯度稳定性调参的工程成本高得吓人ROFT 只需要「跑任务写复盘普通 SFT」——一套数据生成流程就能搭。解释即数据你的智能体每天跑失败的中间产物不是垃圾是「复盘-微调」的原料。BuddyMe可搜下工作流的中间产物落盘正好是这种原料的形态每步产出可回溯失败轨迹完整保留接一段复盘生成微调就是一个自进化闭环的雏形。每天免费 4500 万 token 的额度把「复盘→再试」的循环跑起来不心疼。「学会解释」和「学会做事」的关系这篇给出了第一个规模化答案解释本身就是训练信号。BuddyMe 每日免费 4500 万 Token
返回列表