2025
daDPO: Distribution-Aware DPO for Distilling Conversational Abilities
ACL 2025finding
Large language models (LLMs) have demonstrated exceptional performance across various applications, but their conversational abilities decline sharply as model size decreases, presenting a barrier to their deployment in resource-constrained environments. Knowledge distillation (KD) with Direct Prefe…