2026
Self-Calibrated Consistency can Fight Back for Adversarial Robustness in Vision-Language Models
ICML 2026poster
Pre-trained vision-language models (VLMs) such as CLIP have demonstrated strong zero-shot capabilities across diverse domains, yet remain highly vulnerable to adversarial perturbations that disrupt image-text alignment and compromise reliability. Existing defenses typically rely on adversarial fine-…