2024
SAFARI: Adaptive Sequence Transformer for Weakly Supervised Referring Expression Segmentation
ECCV 2024poster
"Referring Expression Segmentation (RES) aims to provide a segmentation mask of the target object in an image referred to by the text (i.e., referring expression). Existing methods require large-scale mask annotations. Moreover, such approaches do not generalize well to unseen/zero-shot scenarios. T…