2026
MARPO: A Reflective Policy Optimization for Multi-Agent Reinforcement Learning
AAAI 2026technical
We propose Multi-Agent Reflective Policy Optimization MARPO to alleviate the issue of sample inefficiency in multi-agent reinforcement learning. MARPO consists of two key components: a reflection mechanism that leverages subsequent trajectories to enhance sample efficiency, and an asymmetric clippin