← Search

Jianhang Huang

1 accepted papers

2022

Policy Optimization with Stochastic Mirror Descent

AAAI 2022technical

Improving sample efficiency has been a longstanding goal in reinforcement learning. This paper proposes VRMPO algorithm: a sample efficient policy gradient method with stochastic mirror descent. In VRMPO, a novel variance-reduced policy gradient estimator is presented to improve sample efficiency. W…

Cited by 40SourcePDFScholar