【发布时间】:2021-02-26 10:03:47
【问题描述】:
如标题所述,我已经阅读了多个来源,Policy Gradient 方法是 RL,适用于大型动作空间,但我不明白为什么会这样。
我正在尝试看看 RL 是否可以解决我的一个具有巨大组合编号的问题。可能的行动。假设它是关于发送n no。从位置 i 到 j 的项目。 (i,j,n) 的任何组合都是一个可能的动作,并且 (i,j,n) 的大小都在 1000 秒内,这使得可能的动作超过十亿。
由于Policy Gradient方法中神经网络的输出层节点代表没有。的行动。有超过 1000,000,000 种可能的动作,策略梯度如何成为解决此类问题的好方法?
【问题讨论】: