2025
ReferEverything: Towards Segmenting Everything We Can Speak of in Videos
ICCV 2025poster
We present REM, a framework for segmenting a wide range of concepts in video that can be described through natural language. Our method leverages the universal visual-language mapping learned by video diffusion models on Internet-scale data by fine-tuning them on small-scale Referring Object Segment…