2026
Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection
ICML 2026poster
Reinforcement learning with verifiable rewards (RLVR) can yield large reasoning gains from very few training instances, yet its strong sensitivity to which instances are used makes data selection a central bottleneck. Most existing selection pipelines rely on training-time optimization signals and/o…