【问题标题】:Why is the Trust Region Policy Optimization a On-policy algorithm?为什么 Trust Region Policy Optimization 是 On-policy 算法?
【发布时间】:2019-03-27 06:30:21
【问题描述】:

我想知道为什么 Trust Region Policy Optimization 是一种 On-policy 算法?

在我看来,在 TRPO 中,我们通过旧策略进行采样并更新新策略并应用重要性采样来纠正偏差。因此,它更像是一种离策略算法。 但最近,我读到一个paper,上面写着:

与 off-policy 算法相比,on-policy 方法需要 根据当前遵循的更新函数逼近器 政策。特别是,我们将考虑信任区域 PolicyOptimization,传统策略梯度的扩展 使用自然梯度方向的方法。

我有什么误解吗?

【问题讨论】:

    标签: artificial-intelligence reinforcement-learning


    【解决方案1】:

    on-policy 方法的关键特征是它们必须使用估计的策略才能与环境交互。在信任区域策略优化的情况下,它使用当前策略有效地获取样本(即与环境交互),然后更新策略并在下一次迭代中使用新的策略估计。

    所以,算法在学习过程中使用了估计的策略,也就是on-policy方法的定义。

    【讨论】:

    • 那么,PPO 算法也符合政策吗?
    • 是的,它也符合政策。
    猜你喜欢
    • 1970-01-01
    • 2019-11-07
    • 1970-01-01
    • 2021-01-31
    • 1970-01-01
    • 2011-12-01
    • 1970-01-01
    • 2022-12-02
    • 1970-01-01
    相关资源
    最近更新 更多