← Search

Andrew Chung

1 accepted papers

2024

Towards Efficient Visual-Language Alignment of the Q-Former for Visual Reasoning Tasks

EMNLP 2024finding

Recent advancements in large language models have demonstrated enhanced capabilities in visual reasoning tasks by employing additional encoders for aligning different modalities. While the Q-Former has been widely used as a general encoder for aligning several modalities including image, video, audi…