2024
HelpSteer 2: Open-source dataset for training top-performing reward models
NeurIPS 2024poster
High-quality preference datasets are essential for training reward models that can effectively guide large language models (LLMs) in generating high-quality responses aligned with human preferences. As LLMs become stronger and better aligned, permissively licensed preference datasets, such as Open A…