← Search

Jonas Pai

1 accepted papers

2026

mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs

RSS 2026poster

Prevailing Vision-Language-Action Models (VLAs) for robotic manipulation are built upon vision-language backbones pretrained on large-scale, but disconnected static web data. As a result, despite improved semantic generalization, the policy must implicitly infer complex physical dynamics and tempora…

Cited by 0SourceScholar