2026
Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies
ICML 2026poster
Behavior cloning with high-capacity generative policies achieves strong imitation performance, but performance is often constrained by limited demonstration coverage and sensitivity to distribution shift. While reinforcement learning can improve task performance, directly fine-tuning large action de…