染上深度学习之后
强化学习就变得很简单粗暴了
(当然,纯强化学习更呆更楞
DQN是这样
A3C还是这样
从代码上来说
直接把输入加权
过激活函数
弄些通道
多弄几层
中间或者开始的时候分叉
最后到action和value
跟reward,跟V一差
反向求导一下
就是整个过程

然后就是类似神经网络
把track当sample喂到模型
真的是简单粗暴
训练完了拿到测试集看看就完了
效果不好反过来调参
真的是手艺活