← Search

Haanvid Lee

2 accepted papers

2024

Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies

ICLR 2024spotlight

We consider off-policy evaluation (OPE) of deterministic target policies for reinforcement learning (RL) in environments with continuous action spaces. While it is common to use importance sampling for OPE, it suffers from high variance when the behavior policy deviates significantly from the target…

2022

Local Metric Learning for Off-Policy Evaluation in Contextual Bandits with Continuous Actions

NeurIPS 2022accept

We consider local kernel metric learning for off-policy evaluation (OPE) of deterministic policies in contextual bandits with continuous action spaces. Our work is motivated by practical scenarios where the target policy needs to be deterministic due to domain requirements, such as prescription of t…