上一节我们讲述了马尔可夫过程, 这一节我们要讲的是强化学习中常用的方法。
Model-free和Model-based
我们可以将所有强化学习的方法分为理不理解所处环境,如果我们不尝试去理解环境, 环境给了我们什么就是什么. 我们就把这种方法叫做 model-free, 这里的 model 就是用模型来表示环境, 那理解了环境也就是学会了用一个模型来代表环境, 所以这种就是 model-based 方法. 我们假设有一个机器人,在Model-free方法中, 机器人只能按部就班, 一步一步等待真实世界的反馈, 再根据反馈采取下一步行动;而在model-based方法中, 他能通过想象来预判断接下来将要发生的所有情况. 然后选择这些想象情况中最好的那种. 并依据这种情况来采取下一步的策略, 这也就是 围棋场上 AlphaGo 能够超越人类的原因. 接下来, 我们再来用另外一种分类方法将 强化学习分为基于概率和基于价值.。
基于概率和基于价值
基于概率是强化学习中最直接的一种, 他能通过感官分析所处的环境, 直接输出下一步要采取的各种动作的概率, 然后根据概率采取行动, 所以每种动作都有可能被选中, 只是可能性不同. 而基于价值的方法输出则是所有动作的价值, 我们会根据最高价值来选择动作, 相比基于概率的方法, 基于价值的决策部分更为铁定, 毫不留情, 就选价值最高的, 而基于概率的, 即使某个动作的概率最高, 但是还是不一定会选到他。我们现在说的动作都是一个一个不连续的动作, 而对于选取连续的动作, 基于价值的方法是无能为力的. 我们却能用一个概率分布在连续动作中选取特定动作, 这也是基于概率的方法的优点之一。
回合更新和单步更新
如果我们把强化学习类比于玩游戏,游戏有开始和结束,回合更新就是指游戏开始后一定是在结束时才可以更新我们的行为准备。单步更新则是不用等待游戏结束,而是可以在游戏进行中去更新。
在线学习和离线学习
在线学习指的就是学习的过程必须是本人到场,边实践边学习的,而离线学习可以是自己玩也可以是看别人玩,通过观看别人的过程来学习别人的行为准则。离线学习也是从过往的经验中学习,但是这些过往经验可以是自己的也可以是别人的,任何人的经历都能被学习。
Q-learning
Q-learning是一种基于行动-价值函数(action-value function)来评估采取哪种行动的技术,而行动-价值函数决定了在某个状态下采取某个行动的价值。我们有一个函数Q,它以一个状态和一个行动作为输入,并返回该状态下,采取该行动(以及后续所有行动)的期望回报。在我们探索环境之前,Q会随机给定一些固定值。但之后,随着我们探索环境加深,Q会给我们一个越来越好地对于任一状态s下采取行动a的价值估计。我们在过程中不断对Q进行更新。以下这个等式展示了如何基于从环境中获得的回报来更新Q的值:
关注小鲸融创,一起深度学习金融科技!