Offline minimax Q-function learning for undiscounted indefinite-horizon MDPs
摘要
This work considers the offline evaluation problem for indefinite-horizon Markov Decision Processes. A minimax Q-function learning algorithm is proposed, which, instead of i.i.d. tuples