2026
Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking
ICLR 2026poster
Multimodal retrieval still leans on embedding-based models like CLIP for fast vector search over pre-computed image embeddings. Yet, unlike text retrieval where joint-encoder rerankers are standard, comparable vision–language rerankers are largely absent. We find that seminal joint encoders such as…