2025
Imagination-Limited Q-Learning for Offline Reinforcement Learning
IJCAI 2025
Offline reinforcement learning seeks to derive improved policies entirely from historical data but often struggles with over-optimistic value estimates for out-of-distribution (OOD) actions. This issue is typically mitigated via policy constraint or conservative value regularization methods. However