← Search

Federico Mansutti

1 accepted papers

2026

Reusing Trajectories in Policy Gradients Enables Fast Convergence

ICML 2026poster

*Policy gradient* (PG) methods are a class of effective *reinforcement learning* algorithms, particularly when dealing with continuous control problems. They rely on fresh *on-policy* data, making them sample-inefficient and requiring $\mathcal{O}(\epsilon^{-2})$ trajectories to reach an $\epsilon$-…

Cited by 0SourceScholar