2026
MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model
CVPR 2026
Universal Multimodal embedding models built on Multimodal Large Language Models (MLLMs) have traditionally employed contrastive learning, which aligns representations of query-target pairs across different modalities. Yet, despite its empirical success, they are primarily built on a "single-turn" fo