2022
LAPO: Latent-Variable Advantage-Weighted Policy Optimization for Offline Reinforcement Learning
NeurIPS 2022accept
Offline reinforcement learning methods hold the promise of learning policies from pre-collected datasets without the need to query the environment for new samples. This setting is particularly well-suited for continuous control robotic applications for which online data collection based on trial-and…