← Search

Mu Zhang

2 accepted papers

2026

Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models

ICLR 2026poster

Optimizing discrete diffusion model (DDM) with rewards remains a challenge—the non-autoregressive paradigm makes importance sampling intractable and rollout complex, puzzling reinforcement learning methods such as Group Relative Policy Optimization (GRPO). In this study, we introduce **MaskGRPO**, t…

Cited by 0SourcecodeScholar
2026

RebRL: Reinforcing Discrete Visual Diffusion Models with Rebalanced Timestep Credits

CVPR 2026

Discrete Diffusion Models (DDMs) have shown great potential in image generation, especially when equipped with reinforcement learning (RL) techniques.However, a fundamental yet overlooked limitation is revealed in our experiments: severe imbalance of credit assignment across timesteps during trainin

Cited by 0SourceScholar