← Search

Raymond Tsao

1 accepted papers

2026

Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning

ICML 2026spotlight

Standard practice across domains from robotics to language is to first pretrain a policy on a large-scale demonstration dataset, and then finetune this policy, typically with reinforcement learning (RL), in order to improve performance on deployment domains. This finetuning step has proved critical …

Cited by 0SourceScholar