2026
Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random
ICML 2026poster
In offline Reinforcement Learning, immediate rewards in logged batch data are often unobserved due to sparse or irregular record-keeping, or censored beyond certain reward values. This issue frequently arises in practical settings, including health care and marketing. We investigate off-policy evalu…