2025
Scale Down to Speed Up: Dynamic Data Selection for Reinforcement Learning
EMNLP 2025
Optimizing data utilization remains a central challenge in applying Reinforcement Learning (RL) to Large Language Models (LLMs), directly impacting sample efficiency, training stability, and final model performance.Current approaches often rely on massive static datasets, leading to computational in