2025
Whose Instructions Count? Resolving Preference Bias in Instruction Fine-Tuning
NeurIPS 2025poster
Instruction fine-tuning (IFT) has emerged as a ubiquitous strategy for specializing large language models (LLMs), yet it implicitly assumes a single, coherent "ground-truth" preference behind all human-written instructions. In practice, annotators differ in the styles, emphases, and granularities th…