2026
Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory
AAAI 2026technical
Reasoning Video Object Segmentation (ReasonVOS) is a challenging task that requires stable object segmentation across video sequences using implicit and complex textual inputs. Previous methods fine-tune Multimodal Large Language Models (MLLMs) to produce segmentation outputs, which demand substanti