2024
CDA-MBPO: Corrected Data Aggregation for Model-Based Policy Optimization
ICASSP 2024accepted
Model-based reinforcement learning has shown promise in sample efficiency but suffers from errors accumulated during multi-step model sampling. To tackle this issue, we propose corrected data aggregation for model-based policy optimization. This approach involves aligning simulated trajectories with…