强化学习算法最开始只是查表
简单粗暴的遍历算法
无论是策略梯度算法还是价值算法
自然而然有计算量过大,效率不高的问题
从采样上来说,也有蒙特卡洛算法和TD算法的区分
可能是因为计算机计算能力的提升
价值算法中发展出了QLEARNING,SARSA这样的即时价值算法
但是这些算法解决的基本是离散或者复杂度低的问题
真正要抽象出高维度抽象信息
之前的强化学习算法相对来说效率比较低
所以DQN出现了
DQN实际上是另一种QLEARNING
没有策略函数
目标函数来自采样之前遍历的经验数据
最大的创新还是引入了卷积神经网络
同时,也因为神经网络的计算能力
状态和动作空间也模糊掉了
名称,公式/描述,作用
Q 函数,"Q^(s,a;θ)",深度神经网络(CNN)逼近 Q∗。
行为策略,ϵ-Greedy,平衡探索和利用。
经验存储,"et=(st,at,rt+1,st+1)",存储在回放缓冲区 D 中。
TD 目标,"Yt=r+γmaxa′Q^(s′,a′;θ−)",稳定的学习目标(使用目标网络 θ−)。
损失函数,"L(θ)=E[(Yt−Q^(s,a;θ))2]",最小化 TD 误差的均方值。
目标网络更新,θ−←θ (每 C 步),周期性复制,确保目标 Yt 稳定。
不明觉厉