Dyn-VPP: Video Prediction Policy Optimization for Improved Visual Dynamics
Zirui Ge, Pengxiang Ding, Yemin Wang, BaoHuaYin, Qishen Wang, Zhiyong Xie, Hengtao Li, Runze Suo
Abstract
Video action models are a promising foundation for Vision–Language–Action (VLA) because they can learn rich visual dynamics directly from video. However, likelihood-oriented training of diffusion predictors emphasizes globally plausible futures and does not guarantee precision-critical visual dynamics needed for manipulation, so small prediction errors can be amplified by downstream policies. We propose Dyn-VPP, a post-training framework that casts multi-step denoising as policy optimization and aligns predicted future latents with expert visual dynamics via verifiable terminal reward, without modifying any architecture. This enables explicit optimization of dynamics signals that are not captured by likelihood-only training. As a result, Dyn-VPP yields more accurate visual dynamics and improves downstream task execution. Experiments across diverse simulated and real-world manipulation settings show improved dynamics consistency and consistently higher task success.
BibTeX
@inproceedings{
ge2026dynvpp,
title={Dyn-{VPP}: Video Prediction Policy Optimization for Improved Visual Dynamics},
author={Zirui Ge and Pengxiang Ding and Baohua Yin and Yemin Wang and Qishen Wang and Zhiyong Xie and Hengtao Li and Runze Suo and Wenxuan Song and Han Zhao and Shangke Lyu and Haoang Li and Ran Cheng and Cheng Chi and Hui-Bin Ge and Yaozhi Luo and Donglin Wang},
booktitle={Forty-third International Conference on Machine Learning},
year={2026},
url={https://openreview.net/forum?id=35LVVvPRaE}
}