ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

【RL】PPO算法学习笔记

【RL】PPO算法学习笔记 1. 新旧策略比值rt(θ)r_t(\theta)rt​(θ)rt(θ)πθ(at∣st)πθold(at∣st)r_t(\theta) \frac{\pi_\theta(a_t\vert{}s_t)}{\pi_{\theta_{old}}(a_t\vert{}s_t)}rt​(θ)πθold​​(at​∣st​)πθ​(at​∣st​)​物理含义本质衡量策略更新幅度的比值 (Ratio)。分子πθ\pi_\thetaπθ​当前正在训练的新策略采取动作ata_tat​的概率。分母πθold\pi_{\theta_{old}}πθold​​收集数据时冻结的旧策略采取动作ata_tat​的概率。工程作用 (Why it matters)防止策略崩溃rtr_trt​越偏离 1说明新策略相比旧策略跑得越偏。PPO 通过计算这个简单的比值配合clip函数通常限制在[0.8, 1.2]之间以极低的计算成本替代了复杂的 KL 散度计算从而强制限制网络更新的步伐保证训练极其稳定。动态表现遇到好动作Advantage 0网络会推高rtr_trt​遇到坏动作Advantage 0网络会压低rtr_trt​。2. Entropy-loss“有点像图像分类损失中的正则化项”
返回列表