2026
Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning
CVPR 2026
Recent studies have demonstrated significant progress in aligning text-to-image diffusion models with human preference via Reinforcement Learning from Human Feedback. However, while existing methods achieve high scores on automated reward metrics, they often lead to Preference Mode Collapse (PMC)-a