← Search

Xingdong Zuo

1 accepted papers

2023

Direct Preference-based Policy Optimization without Reward Modeling

NeurIPS 2023poster

Preference-based reinforcement learning (PbRL) is an approach that enables RL agents to learn from preference, which is particularly useful when formulating a reward function is challenging. Existing PbRL methods generally involve a two-step procedure: they first learn a reward model based on given…