,

Michael Fairbank1, Danil Prokhorov2, David Barragan-Alcantar1

  • 1School of Computer Science and Electronic Engineering, University of Essex, Colchester, UK.

概括

训练具有分析政策梯度的模拟代理可以导致学习问题. 使用软屏障和梯度剪切或截断有助于避免局部最小值和爆炸梯度,以获得更好的神经控制.