【发布时间】:2018-04-20 06:56:40
【问题描述】:
我正在努力实现Q-Learning 来构建一个人工智能来玩Galaga。
我了解Q-learning 需要状态和操作,以及用于确定状态之间移动的表格。
Q-Learning 在线的所有示例和教程似乎都是基于网格的游戏,具有易于定义的状态。但 Galaga 涉及向左、向右和向上射击,敌人在整个游戏过程中随机移动。所以,我很难定义我在Q-Learning 算法中的状态应该是什么。我考虑过将船的每个潜在位置都视为一个状态,或者可能使状态取决于存活的敌人数量。我什至考虑过为每一帧游戏设置状态,但这显然成本太高了。
如果有人对q-learning 有更好的理解,我将不胜感激,可以帮助我定义我的状态应该是什么。我也理解奖励的必要性,但我不完全确定逐帧的奖励是什么,因为游戏分数只有在敌人被杀死时才会增加。也许是游戏分数和帧数的一些功能。
感谢您的帮助!
【问题讨论】:
标签: q-learning