【问题标题】:How are eligibility traces with SARSA calculated?如何计算 SARSA 的资格痕迹?
【发布时间】:2014-06-26 20:46:03
【问题描述】:

我正在尝试实现资格跟踪(前瞻性),其伪代码可以在下图中找到

我不确定For all s, a 是什么意思(下面的第 5 行)。他们从哪里得到s, a 的集合?

如果是前瞻性的,从当前状态向前循环观察s'

你会调整每一个e(s, a)吗?

【问题讨论】:

    标签: machine-learning reinforcement-learning sarsa


    【解决方案1】:

    不幸的是,他们在这里在两个不同的范围内重用了变量 s 和 a,但是是的,您调整了所有 e(s,a) 值,例如,

    for every state s in your state space
        for every action a in your action space
            update Q(s,a)
            update e(s,a)
    

    注意这里发生了什么。 e(s,a) 以指数递减的量递增。但就在你进入那个循环之前,你增加了与刚刚访问的状态/动作对相对应的 single e(s,a)。所以这对以某种方式“重置”——它没有得到指数级更小的更新,在下一次迭代中,它的更新将继续大于你最近没有访问过的所有对。每次访问状态/动作对时,都会增加它对 Q 更新的权重进行几次迭代。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2021-01-04
      • 2022-10-05
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-01-31
      • 1970-01-01
      相关资源
      最近更新 更多