2026
Dyn-VPP: Video Prediction Policy Optimization for Improved Visual Dynamics
ICML 2026poster
Video action models are a promising foundation for Vision–Language–Action (VLA) because they can learn rich visual dynamics directly from video. However, likelihood-oriented training of diffusion predictors emphasizes globally plausible futures and does not guarantee precision-critical visual dynami…