2025
Offline Actor-Critic for Average Reward MDPs
NeurIPS 2025poster
We study offline policy optimization for infinite-horizon average-reward Markov decision processes (MDPs) with large or infinite state spaces. Specifically, we propose a pessimistic actor-critic algorithm that uses a computationally efficient linear function class for value function estimation. At t…