Decision Making: P-value Method
Reinforcement
Reinforcement Schedules
Improving Translational Accuracy
Improving Translational Accuracy
Rolling Resistance: Problem Solving
您也可能阅读
通过共同作者、期刊和引用图与本文相关的文章。
本研究介绍了强化学习 (RL) 的双标准政策优化 (BPO). 在复杂的控制任务中,BPO使用示范轨迹来提高政策接近的准确性,从而提高比标准方法的性能.
科学领域:
背景情况:
研究的目的:
主要方法:
主要成果:
结论: