染上深度学习之后
强化学习就变得很简单粗暴了
(当然,纯强化学习更呆更楞
DQN是这样
A3C还是这样
从代码上来说
直接把输入加权
过激活函数
弄些通道
多弄几层
中间或者开始的时候分叉
最后到action和value
跟reward,跟V一差
反向求导一下
就是整个过程
然后就是类似神经网络
把track当sample喂到模型
真的是简单粗暴
训练完了拿到测试集看看就完了
效果不好反过来调参
真的是手艺活
染上深度学习之后
强化学习就变得很简单粗暴了
(当然,纯强化学习更呆更楞
DQN是这样
A3C还是这样
从代码上来说
直接把输入加权
过激活函数
弄些通道
多弄几层
中间或者开始的时候分叉
最后到action和value
跟reward,跟V一差
反向求导一下
就是整个过程
然后就是类似神经网络
把track当sample喂到模型
真的是简单粗暴
训练完了拿到测试集看看就完了
效果不好反过来调参
真的是手艺活