【发布时间】:2023-01-23 02:23:12
【问题描述】:
假设我已经实现了一个正常的函数代码来计算所有可能的结果并返回最佳路径。强化与此有何不同?
【问题讨论】:
标签: machine-learning deep-learning reinforcement-learning unsupervised-learning supervised-learning
假设我已经实现了一个正常的函数代码来计算所有可能的结果并返回最佳路径。强化与此有何不同?
【问题讨论】:
标签: machine-learning deep-learning reinforcement-learning unsupervised-learning supervised-learning
不幸的是,有些问题很难通过算法解决。在像 Tic-Tac-Toe 这样的游戏中,可能状态的空间非常小,您可以简单地遍历整个游戏树来找到最佳着法。像国际象棋或围棋这样的游戏有巨大的博弈树,所以用蛮力取胜的策略是不可行的。
其他问题也是如此,比如平衡一根杆子,控制一组电梯等。所有可能的动作和后果的空间太大,无法一一列举,因此手工编写程序来解决这些问题是行不通的。相反,您编写一个学习算法并对其进行训练。这对于游戏来说非常有效,因为您可以让您的系统自己玩。然后它可以玩比人类玩家多几个数量级的游戏。
【讨论】: