MetaAct-RL: Training Language Models for Reasoning Through Meta-Action-Based Reinforcement Learning
Outcome-based reinforcement learning has made notable advances in training language models (LMs) for reasoning. However, without explicit incentives and controls, this paradigm has limitations and instability in eliciting high-quality reasoning trajectories with diverse actions—particularly for mode