← Search

Weitao Lu

1 accepted papers

2026

Towards Better Optimization For Listwise Preference in Diffusion Models

ICLR 2026poster

Reinforcement learning from human feedback (RLHF) has proven effectiveness for aligning text-to-image (T2I) diffusion models with human preferences. Although Direct Preference Optimization (DPO) is widely adopted for its computational efficiency and avoidance of explicit reward modeling, its applica…

Cited by 0SourceScholar