← Search

Long Hoang Dang

2 accepted papers

2025

Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models

AAAI 2025technical

Existing Large Vision-Language Models (LVLMs) excel at matching concepts across multi-modal inputs but struggle with compositional concepts and high-level relationships between entities. This paper introduces Progressive multi-granular Vision-Language alignments (PromViL), a novel framework to enhan…

2021

Hierarchical Object-oriented Spatio-Temporal Reasoning for Video Question Answering

IJCAI 2021poster

Video Question Answering (Video QA) is a powerful testbed to develop new AI capabilities. This task necessitates learning to reason about objects, relations, and events across visual and linguistic domains in space-time. High-level reasoning demands lifting from associative visual pattern recognitio…