2025
Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling
NeurIPS 2025poster
Recently, Direct Alignment Algorithms (DAAs) such as Direct Preference Optimization (DPO) have emerged as alternatives to the standard Reinforcement Learning from Human Feedback (RLHF) for aligning large language models (LLMs) with human values. Surprisingly, while DAAs do not use a separate proxy…