2026
IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models
ICML 2026poster
Generative Reward Models (GRMs) have demonstrated strong performance in reward modeling, due to their interpretability and potential for refinement through reinforcement learning (RL). However, widely used pairwise GRMs create a computational bottleneck in reinforcement learning from human feedback …