2024
Towards Efficient Visual-Language Alignment of the Q-Former for Visual Reasoning Tasks
EMNLP 2024finding
Recent advancements in large language models have demonstrated enhanced capabilities in visual reasoning tasks by employing additional encoders for aligning different modalities. While the Q-Former has been widely used as a general encoder for aligning several modalities including image, video, audi…