DRIFT: Difference-Aware Reinforcement Through Iterative Fine-Tuning for Language Model
Self-play fine-tuning has emerged as a promising approach to improve Large Language Models (LLMs) without additional human annotations. However, existing methods struggle with complex generation tasks requiring long context understanding, where models produce partially correct outputs interleaved wi