2026
Difference Vector Equalization for Robust Fine-tuning of Vision-Language Models
AAAI 2026technical
Contrastive pre-trained vision-language models, such as CLIP, demonstrate strong generalization abilities in zero-shot classification by leveraging embeddings extracted from image and text encoders. This paper aims to robustly fine-tune these vision-language models on in-distribution (ID) data witho