← Search

Lulu Xu

1 accepted papers

2025

MAFMO: Multi-modal Adaptive Fusion with Meta-template Optimization for Vision-Language Models

EMNLP 2025

Vision-language models like CLIP demonstrate exceptional generalization capabilities but face significant adaptation challenges due to parameter scale, prompt sensitivity, and cross-modal alignment difficulties. Existing approaches primarily focus on single-modality adjustments, leading to suboptima

Cited by 0SourcePDFScholar