2026
P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling
ICLR 2026oral
Personalized alignment of large language models seeks to adapt responses to individual user preferences, typically via reinforcement learning. A key challenge is obtaining accurate, user-specific reward signals in open-ended scenarios. Existing personalized reward models face two persistent limitati…