← Search

Dean Slack

1 accepted papers

2025

Everything is a Video: Unifying Modalities through Next-Frame Prediction

ICCV 2025poster

Multimodal learning, which involves integrating information from various modalities such as text, images, audio, and video, is pivotal for numerous complex tasks like visual question answering, cross-modal retrieval, and caption generation. Traditional approaches rely on modality-specific encoders a…