ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

【AI黑话日日新】Day 044|GRPO(分组相对策略优化)

【AI黑话日日新】Day 044|GRPO(分组相对策略优化) 一句话说清:让模型自己跟自己比,哪条回答更得分就多学哪条。1. 它到底在说什么GRPO 是英文 Group Relative Policy Optimization 的缩写,中文译作“分组相对策略优化”。它是一种用来微调大语言模型的强化学习算法,核心思路可以概括成一句话:对同一个问题,让模型一口气生成好几条回答,再拿它们的得分互相比较,得分高于“小组平均分”的就多学一点,低于平均的就少学一点。用一个生活化的类比来理解:传统做法像请一位私教(评论家)盯着你每一次练习,给你逐拍打分;GRPO 则像把一个学习小组放在一起——不请私教,而是让这一组人互相比。某人这次做得比同组平均水平好,就被认为“方向对”,下次更可能这么做;比平均差,就被认为“方向偏”,下次压下去。谁好谁坏,由组内相对位置决定,不需要额外请一位裁判。2. 为什么现在这个词很热GRPO 的走红有一条清晰的时间线。2017 年,OpenAI 的 John Schulman 等人提出 PPO(Proximal Policy Optimization,近端策略优化,arXiv:1707.06347),成为后来 RLHF(Reinforcement Learning from Human Feedb
返回列表