2025
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
NeurIPS 2025poster
Discrete diffusion models have recently gained significant attention due to their ability to process complex discrete structures for language modeling. However, fine-tuning these models with policy gradient methods, as is commonly done in Reinforcement Learning from Human Feedback (RLHF), remains a…