← Search

Urvi Bhuwania

1 accepted papers

2025

Actor-Free Continuous Control via Structurally Maximizable Q-Functions

NeurIPS 2025poster

Value-based algorithms are a cornerstone of off-policy reinforcement learning due to their simplicity and training stability. However, their use has traditionally been restricted to discrete action spaces, as they rely on estimating Q-values for individual state-action pairs. In continuous action sp…

Cited by 0SourceScholar