2026
Improving and Accelerating Offline RL in Large Discrete Action Spaces with Structured Policy Initialization
ICLR 2026poster
Reinforcement learning in combinatorial action spaces requires searching over exponentially many joint actions to simultaneously select multiple sub-actions that form coherent combinations. Existing approaches either simplify policy learning by assuming independence across sub-actions, which often y…