DeepFloodbeta

Day8 DQN

强化学习算法最开始只是查表
简单粗暴的遍历算法
无论是策略梯度算法还是价值算法
自然而然有计算量过大,效率不高的问题
从采样上来说,也有蒙特卡洛算法和TD算法的区分

可能是因为计算机计算能力的提升
价值算法中发展出了QLEARNING,SARSA这样的即时价值算法

但是这些算法解决的基本是离散或者复杂度低的问题
真正要抽象出高维度抽象信息
之前的强化学习算法相对来说效率比较低
所以DQN出现了

DQN实际上是另一种QLEARNING
没有策略函数
目标函数来自采样之前遍历的经验数据
最大的创新还是引入了卷积神经网络
同时,也因为神经网络的计算能力
状态和动作空间也模糊掉了

名称,公式/描述,作用
Q 函数,"Q^​(s,a;θ)",深度神经网络(CNN)逼近 Q∗。
行为策略,ϵ-Greedy,平衡探索和利用。
经验存储,"et​=(st​,at​,rt+1​,st+1​)",存储在回放缓冲区 D 中。
TD 目标,"Yt​=r+γmaxa′​Q^​(s′,a′;θ−)",稳定的学习目标(使用目标网络 θ−)。
损失函数,"L(θ)=E[(Yt​−Q^​(s,a;θ))2]",最小化 TD 误差的均方值。
目标网络更新,θ−←θ (每 C 步),周期性复制,确保目标 Yt​ 稳定。