← Search

Cuiling Wu

1 accepted papers

2026

MARPO: A Reflective Policy Optimization for Multi-Agent Reinforcement Learning

AAAI 2026technical

We propose Multi-Agent Reflective Policy Optimization MARPO to alleviate the issue of sample inefficiency in multi-agent reinforcement learning. MARPO consists of two key components: a reflection mechanism that leverages subsequent trajectories to enhance sample efficiency, and an asymmetric clippin

Cited by 0SourcePDFScholar