Selim Mecanna1, Aurore Loisy2, Christophe Eloy3

  • 1Aix Marseille Univ, CNRS, Centrale Med, IRPHE, Marseille, France.

概括

在流体流中进行自主导航的强化学习表明,像近距离政策优化 (PPO) 这样的先进算法显著优于简单的方法,在复杂的环境中实现近乎最佳的策略.