2025
MAFMO: Multi-modal Adaptive Fusion with Meta-template Optimization for Vision-Language Models
EMNLP 2025
Vision-language models like CLIP demonstrate exceptional generalization capabilities but face significant adaptation challenges due to parameter scale, prompt sensitivity, and cross-modal alignment difficulties. Existing approaches primarily focus on single-modality adjustments, leading to suboptima