2025
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
AAAI 2025technical
Existing Large Vision-Language Models (LVLMs) excel at matching concepts across multi-modal inputs but struggle with compositional concepts and high-level relationships between entities. This paper introduces Progressive multi-granular Vision-Language alignments (PromViL), a novel framework to enhan…