← Search

An Mai

1 accepted papers

2025

Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling

NeurIPS 2025poster

Recently, Direct Alignment Algorithms (DAAs) such as Direct Preference Optimization (DPO) have emerged as alternatives to the standard Reinforcement Learning from Human Feedback (RLHF) for aligning large language models (LLMs) with human values. Surprisingly, while DAAs do not use a separate proxy…

Cited by 0SourcecodeScholar