在具有软屏障的环境中,用于固定长度轨迹的神经控制
Michael Fairbank1, Danil Prokhorov2, David Barragan-Alcantar1
1School of Computer Science and Electronic Engineering, University of Essex, Colchester, UK.
概括
训练具有分析政策梯度的模拟代理可以导致学习问题. 使用软屏障和梯度剪切或截断有助于避免局部最小值和爆炸梯度,以获得更好的神经控制.
科学领域:
- 神经科学是一个神经科学.
- 机器学习 机器学习
- 强化学习是一种强化学习.
背景情况:
- 通过时间反向传播的分析政策梯度用于训练模拟代理.
- 环境中的终端障碍可以导致学习陷入局部最小值或振荡极限周期.
研究的目的:
- 为了解决神经控制问题与终端障碍的学习挑战.
- 提出和评估改善代理人培训稳定性和绩效的方法.
主要方法:
- 实施固定长度轨迹和带有罚款成本的软障碍.
- 研究软障碍对学习梯度的影响.
- 应用梯度剪切和梯度的平滑切割.
主要成果:
- 软障碍可以导致爆炸式学习梯度,通常在不适当的轨迹点.
- 爆炸式梯度与适应性优化器相结合,可以阻止学习.
- 梯度剪切和平滑的剪切有效地减轻爆炸梯度,并改善学习焦点.
结论:
- 软屏障提供了一种避免局部最小值的方法,但引入了梯度问题.
- 谨慎的梯度管理技术对于稳定和有效的神经控制训练至关重要.
- 提出的方法使代理商能够通过专注于相关轨迹部分来更有效地学习.


