← Search

Ziheng Wei

1 accepted papers

2026

Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random

ICML 2026poster

In offline Reinforcement Learning, immediate rewards in logged batch data are often unobserved due to sparse or irregular record-keeping, or censored beyond certain reward values. This issue frequently arises in practical settings, including health care and marketing. We investigate off-policy evalu…

Cited by 0SourceScholar