2025
UniRAG: Universal Retrieval Augmentation for Large Vision Language Models
NAACL 2025findings
Recently, Large Vision Language Models (LVLMs) have unlocked many complex use cases that require Multi-Modal (MM) understanding (e.g., image captioning or visual question answering) and MM generation (e.g., text-guided image generation or editing) capabilities. To further improve the output fidelity…