2026
Regret-Guided Search Control for Efficient Learning in AlphaZero
ICLR 2026poster
Reinforcement learning (RL) agents achieve remarkable performance but remain far less learning efficient than humans. While RL agents require extensive self-play games to extract useful signals, humans often need only a few games, improving rapidly by repeatedly revisiting states where mistakes occu…