← Search

Luhan Zhu

1 accepted papers

2025

Doubly Robust Alignment for Large Language Models

NeurIPS 2025poster

This paper studies reinforcement learning from human feedback (RLHF) for aligning large language models with human preferences. While RLHF has demonstrated promising results, many algorithms are highly sensitive to misspecifications in the underlying preference model (e.g., the Bradley-Terry model),…

Cited by 0SourcecodeScholar