2026
State Proficiency-Based Adaptive Fine-Tuning for Offline-to-Online Reinforcement Learning
AAAI 2026technical
In offline-to-online (O2O) reinforcement learning, achieving efficient performance improvement while maintaining training stability remains a critical challenge for effective fine-tuning. Existing O2O methods usually focus on the balance between policy improvement and policy constraint during online