Reinforcement Learning for Fully Observable Models: Convergence to Near Optimality under Weak Feller Continuity
摘要
Abstract