2024
Video-Text Prompting for Weakly Supervised Spatio-Temporal Video Grounding
EMNLP 2024main
Weakly-supervised Spatio-Temporal Video Grounding(STVG) aims to localize target object tube given a text query, without densely annotated training data. Existing methods extract each candidate tube feature independently by cropping objects from video frame feature, discarding all contextual informat…