← Search

Mong Yuan Sim

2 accepted papers

2025

Can VLMs Actually See and Read? A Survey on Modality Collapse in Vision-Language Models

ACL 2025finding

Vision-language models (VLMs) integrate textual and visual information, enabling the model to process visual inputs and leverage visual information to generate predictions. Such models are demanding for tasks such as visual question answering, image captioning, and visual grounding. However, some re…

Cited by 0SourcePDFScholar
2025

The More, The Better? A Critical Study of Multimodal Context in Radiology Report Summarization

EMNLP 2025

The Impression section of a radiology report summarizes critical findings of a radiology report and thus plays a crucial role in communication between radiologists and physicians. Research on radiology report summarization mostly focuses on generating the Impression section by summarizing informatio

Cited by 0SourcePDFScholar