2024
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
AAAI 2024technical
Model-based offline reinforcement learning (RL) has made remarkable progress, offering a promising avenue for improving generalization with synthetic model rollouts. Existing works primarily focus on incorporating pessimism for policy optimization, usually via constructing a Pessimistic Markov Decis…