2024
Entropy-regularized Diffusion Policy with Q-Ensembles for Offline Reinforcement Learning
NeurIPS 2024poster
Diffusion policy has shown a strong ability to express complex action distributions in offline reinforcement learning (RL). However, it suffers from overestimating Q-value functions on out-of-distribution (OOD) data points due to the offline dataset limitation. To address it, this paper proposes a n…