2026
Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training
ICML 2026poster
Supervised fine-tuning (SFT) is computationally efficient but often yields inferior generalization compared to reinforcement learning (RL). This gap is primarily driven by RL’s use of on-policy data. We propose a framework to bridge this chasm by enabling On-Policy SFT. We first present ***Distribut…