← Search

dai ming

1 accepted papers

2024

SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion

NeurIPS 2024poster

Visual grounding is a common vision task that involves grounding descriptive sentences to the corresponding regions of an image. Most existing methods use independent image-text encoding and apply complex hand-crafted modules or encoder-decoder architectures for modal interaction and query reasoning…