【发布时间】:2018-05-03 12:51:18
【问题描述】:
我有一个关于Monte Carlo Tree Search 的小问题但可能很愚蠢。我了解其中的大部分内容,但一直在研究一些实现,并注意到在针对给定状态运行 MCTS 并返回最佳移动之后,树被丢弃。所以下一步,我们必须在这个新状态上从头开始运行 MCTS 以获得下一个最佳位置。
我只是想知道为什么我们不保留旧树中的一些信息。似乎有关于老树中状态的有价值的信息,特别是考虑到最好的举动是 MCTS 探索最多的地方。我们不能以某种有用的方式使用这些旧信息有什么特别的原因吗?
【问题讨论】:
-
可能是因为随机依赖。根本问题发生了变化,因此可能会遍历不同的路径。在 minmax 中,我认为,考虑到 50 步的决定,我们可以重用 1/50 我们已经预先计算的数据(简化;损失很大),但在 MCTS 中,就数学证明而言,它可能不是那么微不足道,如果我们是否要重复使用这些。我认为this paper 正在分析这个(第 5 章)。这是一个有趣的问题,但我确信它不太适合 StackOverflow,因为该主题远离编码和更多数学
-
仅供参考(以上评论太长):我链接的论文叫
Powley, Edward J., Peter I. Cowling, and Daniel Whitehouse. "Information capture and reuse strategies in Monte Carlo Tree Search, with applications to games of hidden information." Artificial Intelligence 217 (2014): 92-116.
标签: algorithm artificial-intelligence montecarlo