Can VLMs Actually See and Read? A Survey on Modality Collapse in Vision-Language Models
Vision-language models (VLMs) integrate textual and visual information, enabling the model to process visual inputs and leverage visual information to generate predictions. Such models are demanding for tasks such as visual question answering, image captioning, and visual grounding. However, some re…