2024
COPlanner: Plan to Roll Out Conservatively but to Explore Optimistically for Model-Based RL
ICLR 2024poster
Dyna-style model-based reinforcement learning contains two phases: model rollouts to generate sample for policy learning and real environment exploration using current policy for dynamics model learning. However, due to the complex real-world environment, it is inevitable to learn an imperfect dynam…