2025
Reflective Verbal Reward Design for Pluralistic Alignment
IJCAI 2025
AI agents are commonly aligned with "human values" through reinforcement learning from human feedback (RLHF), where a single reward model is learned from aggregated human feedback and used to align an agent's behavior. However, human values are not homogeneous--different people hold distinct and som