← Search

Alex Slivkins

2 accepted papers

2024

Oracle-Efficient Pessimism: Offline Policy Optimization In Contextual Bandits

AISTATS 2024poster

We consider offline policy optimization (OPO) in contextual bandits, where one is given a fixed dataset of logged interactions. While pessimistic regularizers are typically used to mitigate distribution shift, prior implementations thereof are either specialized or computationally inefficient. We pr…

Cited by 11SourcePDFScholar