【问题标题】:Improving Default Policy(Rollout Policy) in Mont Carlo Tree Search改进蒙特卡洛树搜索中的默认策略(Rollout Policy)
【发布时间】:2016-01-20 03:41:45
【问题描述】:

我已经用 python 编写了 MCTS AI,现在,我正在尝试改进它的第一次迭代。有人告诉我,我需要改进我的推出功能。人工智能的目的是玩点和盒子的游戏。

现在,在收到游戏状态后,rollout 只是随机播放游戏的剩余部分。

推出:

    while not state.is_terminal:
        state.apply_move(choice(state.legal_moves))

我想知道如何通过更改推出功能来改进 AI?

【问题讨论】:

    标签: python python-3.x tree artificial-intelligence montecarlo


    【解决方案1】:

    在点数中,随机游戏可能很糟糕,因为它会 (1) 错失填满盒子的机会,(2) 给对手填满盒子的机会,这两者都会让比赛变得不像真正的比赛。

    因此,最简单的更改是在比赛中对动作进行排序。首先,如果可能的话,采取随机移动填满一个盒子。其次,采取不让对手有机会填满盒子的随机动作。最后,给对手一个填满箱子的机会。 (但是,在这里你可能想要选择一个让对手以高概率填充的最小区域的移动。)

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-06-27
      • 2020-04-09
      • 2012-02-21
      • 2017-08-12
      • 1970-01-01
      • 2018-05-03
      • 2014-07-11
      • 1970-01-01
      相关资源
      最近更新 更多