← Search

Chan Woo Kim

2 accepted papers

2023

Sequential Preference Ranking for Efficient Reinforcement Learning from Human Feedback

NeurIPS 2023poster

Reinforcement learning from human feedback (RLHF) alleviates the problem of designing a task-specific reward function in reinforcement learning by learning it from human preference. However, existing RLHF models are considered inefficient as they produce only a single preference data from each human…

Cited by 11SourcePDFScholar