2025
Everything is a Video: Unifying Modalities through Next-Frame Prediction
ICCV 2025poster
Multimodal learning, which involves integrating information from various modalities such as text, images, audio, and video, is pivotal for numerous complex tasks like visual question answering, cross-modal retrieval, and caption generation. Traditional approaches rely on modality-specific encoders a…