Is Your (Reasoning) Multimodal Language Model Vulnerable Toward Distractions?
Vision-Language Models (VLMs) have achieved success in tasks such as visual question answering, yet their resilience to distractions remains underexplored. Understanding how distractions affect VLMs