2024
Exclusively Penalized Q-learning for Offline Reinforcement Learning
NeurIPS 2024spotlight
Constraint-based offline reinforcement learning (RL) involves policy constraints or imposing penalties on the value function to mitigate overestimation errors caused by distributional shift. This paper focuses on a limitation in existing offline RL methods with penalized value function, indicating t…