ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

RL-赵-(八)-Value函数拟合算法01-StateValue估算:TD函数逼近算法05【案例:用线性逼近器/TD-Linear估计State Values(策略评估问题)】

RL-赵-(八)-Value函数拟合算法01-StateValue估算:TD函数逼近算法05【案例:用线性逼近器/TD-Linear估计State Values(策略评估问题)】 一、案例背景考虑一个5×5的网格世界示例:给定一个策略,对于任意的s,as,as,a:π(a∣s)=0.2\pi(a|s)=0.2π(a∣s)=0.2我们的目标是基于该策略,估计state values (策略评估问题)总计有25种state values。设置:rforbidden = rboundary = −1,rtarget = 1,γ=0.9r_{forbidden}\:=\:r_{boundary}\:=\:-1,r_{target}\:=\:1,\gamma=0.9rforbidden​=rboundary​=−1,rtarget​=1,γ=0.9这个例子我们仍然考虑我们的grid-world example,这里是5*5的 一共有25个状态量。首先我们给出来了一个策略 用箭头大家也可以看到,这个策略是一个探索性的策略,在每一个状态它对5个action都有相同的概率都是0.2。我们下面要做的是什么呢?就是估计这个策略所对应的state value,对每一个状态我都要计算出来它的state value,这个本质上来说是一个policy evaluation的问题。如果我用基于表格的方法我肯定要存储25个state value,但是下面我要用TD-Linear的方法来计算,大家可以看到我们能够用比较少的参数也能够比较好地去近似这25个state value。Ground truth(求解贝尔曼公式的方法得到的每一个state真正的最优state value):为了实现这样的一个目标,我们需要数据(我们没有模型的情况下我们就需要数据),Experience 样本:这里的数据是我们一共有500个episode,然后每个episode有500步。每一个episode的出发的state action pair是随机选择的,并且服从一个均匀分布。二、求解方案1、表格形式的TD算法(TD-Table)为了对比,首先给出表格形式的TD算法(TD-Table)的结果:2、用 TD-Linear 来估计 State Value2.1 用平面进行拟合那么看一下TD-Linear是否也能很好估计出来state value呢?那么看一下TD-Linear是否也能很好估计出来state value呢?第一步就是要建立feature vector。要建立一个函数,这个函数也对应一个曲面,这个曲面能很好地拟合Q^{\mathrm{Q}}
返回列表