【发布时间】:2017-11-16 03:02:07
【问题描述】:
当我的树变得足够深以至于开始选择终端节点时,我会假设我应该从它执行零移动“播放”并反向传播结果,但IEEE survey of MCTS methods 表示选择步骤应该是找到“最紧急的可扩展节点”,我在其他地方找不到任何反例。我应该以某种方式排除他们吗?在这里做什么是正确的?
【问题讨论】:
标签: artificial-intelligence montecarlo
当我的树变得足够深以至于开始选择终端节点时,我会假设我应该从它执行零移动“播放”并反向传播结果,但IEEE survey of MCTS methods 表示选择步骤应该是找到“最紧急的可扩展节点”,我在其他地方找不到任何反例。我应该以某种方式排除他们吗?在这里做什么是正确的?
【问题讨论】:
标签: artificial-intelligence montecarlo
如果您实际上在选择阶段到达了终端节点,您可能会跳过扩展和播放(它们不再有意义)并直接反向传播该终端节点的值。
从您链接的论文中,这在第 6 页并不清楚,但在第 9 页的算法 2 中很清楚。在该伪代码中,TreePolicy() 函数最终将返回一个终端节点 v。当然后将此节点传递给DefaultPolicy()函数,该函数将直接返回奖励(该函数的while循环条件永远不会满足)。
如果您对算法有很好的直观理解,并且希望它能够保证在无限长的处理时间下对值进行最佳估计,那么这也是您想要做的事情。在无限量的处理时间(无限数量的模拟)下,您将希望无限频繁地备份“最佳”终端状态的值,以便更接近根节点的备份的平均值也收敛到那些限制内的最佳叶节点值。
【讨论】: