2026
GRAM-R²: Self-Training Generative Foundation Reward Models for Reward Reasoning
AAAI 2026technical
Major progress in reward modeling over recent years has been driven by a paradigm shift from task-specific designs to generalist reward models. Despite this trend, developing effective reward models remains a fundamental challenge: the heavy reliance on large-scale labeled preference data. Pre-train