【发布时间】:2018-07-12 23:55:27
【问题描述】:
我正在尝试了解 DQN 中的 epsilon - 贪婪方法。我正在学习https://github.com/karpathy/convnetjs/blob/master/build/deepqlearn.js中提供的代码
以下是epsilon的更新规则,随年龄变化如下:
$this.epsilon = Math.min(1.0, Math.max(this.epsilon_min, 1.0-(this.age - this.learning_steps_burnin)/(this.learning_steps_total - this.learning_steps_burnin)));
这是否意味着 epsilon 值以 min(由用户选择)开始,然后随着年龄的增长而增加,直至达到老化步骤并最终变为 1?或者 epsilon 是否从 1 开始,然后衰减到 epsilon_min ?
不管怎样,在这个过程之后学习几乎停止了。那么,我们是否需要足够仔细地选择 learning_steps_burnin 和 learning_steps_total 呢?关于需要选择什么值的任何想法?
【问题讨论】:
标签: performance neural-network deep-learning reinforcement-learning q-learning