MRACL: Multi-Reward Space Guided Adaptive Curriculum Reinforcement Learning for LLMs
Reinforcement learning (RL) has recently become a powerful yet resource-intensive approach for post-training large language models (LLMs). Incorporating curriculum learning (CL) into RL has been shown to significantly improve training efficiency, particularly in reasoning tasks. However, existing CL