2026
How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?
ICML 2026poster
Diffusion policy sampling enables reinforcement learning (RL) to represent multimodal action distributions beyond suboptimal unimodal Gaussian policies. However, existing diffusion-based RL methods primarily focus on offline setting for reward maximization, with limited consideration of safety in on…