A3C在获取样本及更新参数上
是异步的
简单来说
多个actor行动返回样本
更新参数
是各自完成的
因为各样本action可能差异特别大
对theta的更新会有无意义的噪音
因而会降低学习率
来降低一次性噪音的干扰

而PPO则采取一些方式来限制
一方面它是同步更新
多个actor采样之后
获取的结果全部汇集在一起
来更新参数
另一方面,
通过求最优时加调整系数
来调节策略的冒险倾向
防止采样采到过多噪音
或者是加线性修正项
文章中用的是KL散度
调整更新的策略和原策略之间的差距

当然,约束了也在损失函数上加了一个鼓励探索的策略熵
(真的,这些算法就是工程性的算法
(没啥有趣的东西