【问题标题】:Why is Policy Gradient method for Reinforcement Learning good for LARGE action spaces为什么强化学习的策略梯度方法对大动作空间有好处
【发布时间】:2021-02-26 10:03:47
【问题描述】:

如标题所述,我已经阅读了多个来源,Policy Gradient 方法是 RL,适用于大型动作空间,但我不明白为什么会这样。

我正在尝试看看 RL 是否可以解决我的一个具有巨大组合编号的问题。可能的行动。假设它是关于发送n no。从位置 i 到 j 的项目。 (i,j,n) 的任何组合都是一个可能的动作,并且 (i,j,n) 的大小都在 1000 秒内,这使得可能的动作超过十亿。

由于Policy Gradient方法中神经网络的输出层节点代表没有。的行动。有超过 1000,000,000 种可能的动作,策略梯度如何成为解决此类问题的好方法?

【问题讨论】:

    标签: gradient policy


    【解决方案1】:

    对于较大或连续的动作空间,您需要使用函数逼近方法来逼近最优策略。这称为策略近似。有许多可能的方法,包括最小二乘优化或基于梯度的优化。几乎所有这些技术都利用随机抽样来产生和比较在无限时间范围内最大化回报的可能行动。

    来自 Sutton 和 Barto 的 RL 书籍 1

    基于策略的方法提供了处理大型动作空间的实用方法,甚至是具有无限数量动作的连续空间。我们不是为许多动作中的每一个计算学习概率,而是学习概率分布的统计数据。例如,动作集可能是实数,动作选自正态(高斯)分布。

    退房:

    • Sutton and Barto's 书中的第 13.7 节以获得更多理论解释
    • This GitHub repo 获取有解决此问题的可行方法的代码示例

    【讨论】:

    • 谢谢。所以对于我上面可能有超过 10 亿个动作的例子,我的神经网络的输出层应该在 Policy Gradient 方法中是什么?我不可能有一个节点来执行一项操作。
    • 这取决于动作空间的维度。假设您的环境是一辆 2D 汽车,它必须将自己停在图表上的某个点。代理的任务是通过输入 2 个变量来控制汽车:力和转动扭矩。因此,您的代理必须预测一个二维向量:[F, M],其中两者都是连续变量。在这种情况下,NN 中的最后一层将是二维的(有 2 个单元)。
    • 请注意,与离散动作空间不同,神经网络预测多个动作的概率分布 - 对于连续动作空间中的策略近似,输出为单个动作,无论是 1 维还是 N 维。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-02-25
    • 2015-11-19
    • 2018-11-05
    • 2019-12-05
    • 2016-10-24
    相关资源
    最近更新 更多