← Search

Shivani Upadhyay

1 accepted papers

2025

UniRAG: Universal Retrieval Augmentation for Large Vision Language Models

NAACL 2025findings

Recently, Large Vision Language Models (LVLMs) have unlocked many complex use cases that require Multi-Modal (MM) understanding (e.g., image captioning or visual question answering) and MM generation (e.g., text-guided image generation or editing) capabilities. To further improve the output fidelity…