线Q

Jie Liu1, Yinmin Zhang2, Chuming Li2

  • 1The Chinese University of Hong Kong, Shatin, NT, Hong Kong Special Administrative Region of China; Shanghai Artificial Intelligence Laboratory, No. 701, Yunjin Road, Shanghai, China.

概括

离线强化学习 (RL) 方法解决了分布之外的操作中的错误. 通过目标Q值 (APTQ) 新的自适应悲观主义算法通过自适应地平衡约束和目标来改善政策学习.