2026
Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
ICML 2026spotlight
Standard practice across domains from robotics to language is to first pretrain a policy on a large-scale demonstration dataset, and then finetune this policy, typically with reinforcement learning (RL), in order to improve performance on deployment domains. This finetuning step has proved critical …