2026
Reward Shaping Control Variates for Off-Policy Evaluation Under Sparse Rewards
ICML 2026poster
Off-policy evaluation (OPE) is essential for deploying reinforcement learning in safety-critical settings, yet existing estimators such as importance sampling and doubly robust (DR) often exhibit prohibitively high variance when rewards are sparse. In this work, we introduce Reward-Shaping Control V…