2025
STAR: Efficient Preference-based Reinforcement Learning via Dual Regularization
NeurIPS 2025poster
Preference-based reinforcement learning (PbRL) bypasses complex reward engineering by learning from human feedback. However, due to the high cost of obtaining feedback, PbRL typically relies on a limited set of preference-labeled samples. This data scarcity introduces two key inefficiencies: (1) the…