【发布时间】:2013-08-01 22:30:43
【问题描述】:
我学习和应用强化学习的玩具项目是:
- 代理试图“安全”和“快速”地达到目标状态....
- 但是有射弹和火箭在途中向代理发射。
- 代理可以确定火箭的位置 - 有一些噪音 - 只有当它们“靠近”时
- 然后代理必须学会避免撞到这些火箭..
- 代理具有 - 可随时间充电 - 燃料 在代理运动中消耗
- 连续动作:向前加速 - 带角度转弯
我需要一些适合这种情况的强化学习算法的提示和名称..
- 我认为它是 POMDP ,但我可以将其建模为 MDP 并忽略噪音吗?
- 如果是 POMDP,评估概率的推荐方法是什么?
- 在这种情况下使用哪个更好:价值函数或策略迭代?
- 我可以使用 NN 来模拟环境动力学而不是使用显式方程吗?
- 如果是,是否有特定类型/型号的神经网络可以推荐?
- 我认为动作必须离散化,对吧?
我知道学习这样一个主题需要时间和精力,但我渴望..
如果您不能回答所有问题,您可以回答一些问题...
谢谢
【问题讨论】:
-
这最好分成多个具体问题。
标签: machine-learning neural-network reinforcement-learning