接Day11
多步学习
也就是把多走几步的r累加一段,之后再来算预测Q
$$\mathbf{Y_t^{(n)} = R_t^{(n)} + \gamma^n \max_{a'} Q_{\bar{\theta}}(S_{t+n}, a')}$$
怀疑这个有没有用
它起作用与否取决于奖励r本身的分布特性
如果R的variance比较小,就没咐必要
分布学习
也就是每次的状态和采取的动作获得的结果是一个分布
其实这是改了题设
不算一种新的方法
$$\mathbf{Z(s, a) \stackrel{D}{=} R + \gamma Z(s', a')}$$
方法本身是要用样本来逼近真实分布的
Loss用的是比较常见的KL散度
噪声网络
一般的强化学习在探索的时候,会加入随机变量来自由探索
噪声网络是给各个权重加了分布
$$\mathbf{y = (\mu^w + \sigma^w \odot \epsilon^w)x + (\mu^b + \sigma^b \odot \epsilon^b)}$$
这样的效果固然好
其实对样本的需求会更大
而且在公式中,variance是和奖励挂钩
如果随机探索的奖励大,权重上的variance也会大
从rainbow论文来说加权回放和多步学习是比较有用的。
rainbow就是把这几种方法放到了一起
ai总结