【问题标题】:Reinforcement learning of a policy for multiple actors in large state spaces大型状态空间中多个参与者的策略强化学习
【发布时间】:2012-02-17 19:52:44
【问题描述】:

我有一个实时域,我需要将一个动作分配给 N 个参与者,涉及将 O 个对象之一移动到 L 个位置之一。在每个时间步,我都会得到一个奖励 R,表示所有参与者的整体成功。

我有 10 个演员、50 个独特的对象和 1000 个位置,所以对于每个演员我必须从 500000 个可能的动作中进行选择。此外,我可能会考虑 50 个环境因素,例如每个物体与墙壁的距离,或者它与演员的距离。这会导致每个参与者有 25000000 个潜在操作。

几乎所有强化学习算法似乎都不适合这个领域。

首先,它们几乎都涉及评估给定状态下每个动作的预期效用。我的状态空间很大,所以即使我使用函数逼近,使用像 Q-learning 这样原始的东西来收敛一个策略也需要很长时间。即使我可以,从每个时间步的一百万个动作中找到最佳动作也需要很长时间。

其次,大多数算法假设每个参与者只有一个奖励,而我获得的奖励可能会被一个或多个参与者的错误所污染。

我应该如何解决这个问题?我没有找到此类领域的代码,而且我发现的关于多角色强化学习算法的几篇学术论文也没有提供几乎足够的细节来重现所提出的算法。

【问题讨论】:

  • 实际问题是什么?在 K 个“环境因素”下“移动 O 对象之一”可能不是最有效的构图方式。
  • 这是一个物理仓库优化任务。各种机器人(即演员)必须决定移动 N 个不同物体中的哪一个,以及移动到哪里。通过“环境因素”,我的意思是演员与对象和每个建议的目标位置的距离,对象本身与目标位置的距离,目标位置与墙壁的距离等。他们被赋予思考和反应的时间有限(因此没有对数据进行批量分析),并且只能获得 [0:1] 的简单浮点奖励反馈。不是令人兴奋的东西,但它仍然是一个巨大的领域。

标签: machine-learning reinforcement-learning


【解决方案1】:

澄清问题

N=10 个演员
O=50 个对象
L=1K 地点
S=50 个特征

据我了解,您有一个仓库,里面有 N 个演员、O 个对象、L 个位置和一些墙壁。目标是确保每个 O 个对象在最短的时间内到达 L 个位置中的任何一个。动作空间包括决定哪个参与者应该在任何时间点将哪个对象移动到哪个位置。状态空间由大约 50 个 X 维环境因素组成,其中包括演员和对象与墙壁和彼此之间的接近程度等特征。因此,乍一看,您有 XS(OL)N 个动作值,其中大多数动作维度都是离散的。

上述问题不适合强化学习。然而,目前尚不清楚环境因素到底是什么,以及有多少限制是自我强加的。所以,让我们看一个相关但不同的问题。

解决不同的问题

我们只看一个演员。比如说,它知道自己在仓库中的位置、其他 9 个演员的位置、50 个对象的位置和 1000 个位置。它希望获得最大的奖励,这发生在 50 个对象中的每一个都位于 1000 个位置之一时。

假设,我们有一个 P 维表示仓库中的位置。每个位置都可能被焦点中的演员、其他演员之一、物体或位置占据。动作是选择一个对象和一个位置。因此,我们有一个 4P 维状态空间和一个 P2 维动作空间。换句话说,我们有一个 4PP2 维值函数。通过进一步试验表示,对不同的参数使用不同精度的编码,并使用 options 2,有可能将问题带入实际领域。

关于在复杂空间环境中学习的例子,我建议阅读 Konidaris 论文12


1 Konidaris, G.、Osentoski, S. 和 Thomas, P.,2008 年。使用傅里叶基础的强化学习中的价值函数逼近。 计算机科学系教师出版物系列,p。 101.

2 Konidaris, G. & Barto, A.,2009 年。使用技能链 Y 在持续强化学习领域发现技能。 Bengio 等人,编辑。神经信息处理系统的进展,18,pp.1015-1023。

【讨论】:

  • 这是对我的问题的一个很好的改写。但是,如果您要引用论文,请尽可能提供链接。
猜你喜欢
  • 2015-11-19
  • 2019-08-04
  • 1970-01-01
  • 1970-01-01
  • 2019-05-31
  • 1970-01-01
  • 2019-04-17
  • 2022-06-19
  • 2022-09-28
相关资源
最近更新 更多