MADA-Attack: Transferable Multi-modal Attention Distraction Adversarial Attack against Vision Language Models
Vision Language Models (VLMs) achieve strong performance across multi-modal tasks but remain vulnerable to universal adversarial perturbations (UAPs). Existing UAP methods mainly operate on the visual modality, overlooking structured textual semantics and cross-modal interactions, which limits their…