← Search

Yasmeen George

1 accepted papers

2026

Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection

ICML 2026poster

Reinforcement learning with verifiable rewards (RLVR) can yield large reasoning gains from very few training instances, yet its strong sensitivity to which instances are used makes data selection a central bottleneck. Most existing selection pipelines rely on training-time optimization signals and/o…

Cited by 0SourceScholar