$\alpha$-DPO: Robust Preference Alignment for Diffusion Models via $\alpha$ Divergence
Diffusion models have demonstrated remarkable success in high-fidelity image generation, yet aligning them with human preferences remains challenging. Direct Preference Optimization (DPO) offers a promising framework, but its effectiveness is critically hindered by noisy data arising from mislabeled…