2026
HieRD: Hierarchical Relational Distillation for Vision-Language Embedding Models
ICML 2026poster
Knowledge distillation is crucial for compressing large Vision–Language Models (VLMs) into efficient architectures. While prior VLM research has primarily focused on reasoning tasks like visual question answering, multimodal embedding learning, a key component for large-scale retrieval, has received…