【发布时间】:2019-04-28 16:27:19
【问题描述】:
在研究强化学习时,确切地说,在涉及无模型强化学习时,我们通常使用两种方法:
- TD 学习
- 蒙特卡洛
什么时候使用它们中的每一个?换句话说,我们如何确定哪种方法最适合我们的问题?
【问题讨论】:
标签: machine-learning reinforcement-learning montecarlo temporal-difference
在研究强化学习时,确切地说,在涉及无模型强化学习时,我们通常使用两种方法:
什么时候使用它们中的每一个?换句话说,我们如何确定哪种方法最适合我们的问题?
【问题讨论】:
标签: machine-learning reinforcement-learning montecarlo temporal-difference
Sutton & Barto 的第 6.1 和 6.2 节对蒙特卡洛和 TD 学习之间的区别提供了非常直观的理解。
话虽如此,MC 方法与非情节任务当然存在明显的不兼容性。在这种情况下,您总是需要某种引导。
【讨论】: