ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

RL-02-赵-基于模型:贝尔曼/Bellman公式04-2【从Bellman方程求解State Value:①闭式解:v_π=(ɪ-γP_π)⁻¹v_π②迭代解:vₖ₊₁=r_π+γP_π·vₖ】

RL-02-赵-基于模型:贝尔曼/Bellman公式04-2【从Bellman方程求解State Value:①闭式解:v_π=(ɪ-γP_π)⁻¹v_π②迭代解:vₖ₊₁=r_π+γP_π·vₖ】 2.7 从贝尔曼方程求解状态价值(Solving State Values from the Bellman Equation)计算给定策略的状态价值是强化学习中的一个基本问题。这个问题通常称为策略评估(Policy Evaluation)。本节介绍两种通过贝尔曼方程计算状态价值的方法。2.7.1 闭式解(Closed-Form Solution)由于vπ
返回列表