Adaptive pessimism via target Q-value for offline reinforcement learning.

Jie Liu1, Yinmin Zhang2, Chuming Li2

  • 1The Chinese University of Hong Kong, Shatin, NT, Hong Kong Special Administrative Region of China; Shanghai Artificial Intelligence Laboratory, No. 701, Yunjin Road, Shanghai, China.

Summary

Offline reinforcement learning (RL) methods address errors from out-of-distribution actions. The new Adaptive Pessimism via Target Q-value (APTQ) algorithm improves policy learning by adaptively balancing constraints and objectives.