2026
Seeing What Matters: Visual Preference Policy Optimization for Visual Generation
CVPR 2026
Reinforcement learning (RL) has become a powerful tool for post-training visual generative models, with Group Relative Policy Optimization (GRPO) increasingly used to align generators with human preferences. However, existing GRPO pipelines rely on a single scalar reward per sample, treating each im