← Search

Daniel A. Keim

1 accepted papers

2025

ResponseRank: Data-Efficient Reward Modeling through Preference Strength Learning

NeurIPS 2025poster

Binary choices, as often used for reinforcement learning from human feedback (RLHF), convey only the *direction* of a preference. A person may choose apples over oranges and bananas over grapes, but *which preference is stronger*? Strength is crucial for decision-making under uncertainty and general…

Cited by 0SourceScholar