2025
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
IROS 2025
In offline reinforcement learning, value overestimation caused by out-of-distribution (OOD) actions significantly limits policy performance. Recently, diffusion models have been leveraged for their strong distribution-matching capabilities, enforcing conservatism through behavior policy constraints.