【发布时间】:2019-03-27 06:30:21
【问题描述】:
我想知道为什么 Trust Region Policy Optimization 是一种 On-policy 算法?
在我看来,在 TRPO 中,我们通过旧策略进行采样并更新新策略并应用重要性采样来纠正偏差。因此,它更像是一种离策略算法。 但最近,我读到一个paper,上面写着:
与 off-policy 算法相比,on-policy 方法需要 根据当前遵循的更新函数逼近器 政策。特别是,我们将考虑信任区域 PolicyOptimization,传统策略梯度的扩展 使用自然梯度方向的方法。
我有什么误解吗?
【问题讨论】:
标签: artificial-intelligence reinforcement-learning