Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random
In offline Reinforcement Learning, immediate rewards in logged batch data are often unobserved due to sparse or irregular record-keeping, or censored beyond certain reward values. This issue frequently arises in practical settings, including health care and marketing. We investigate off-policy evalu…