← Search

Kyu Ri Park

3 accepted papers

2026

Leveraging Textual Compositional Reasoning for Robust Change Captioning

AAAI 2026technical

Change captioning aims to describe changes between a pair of images. However, existing works rely on visual features alone, which often fail to capture subtle but meaningful changes because they lack the ability to represent explicitly structured information such as object relationships and composit

Cited by 0SourcePDFScholar
2024

Enhancing Audio-Visual Question Answering with Missing Modality via Trans-Modal Associative Learning

ICASSP 2024accepted

We present a novel method for Audio-Visual Question Answering (AVQA) in real-world scenarios where one modality (audio or visual) can be missing. Inspired by human cognitive processes, we introduce a Trans-Modal Associative (TMA) memory that recalls missing modal information (i.e., pseudo modal feat…

Cited by 0SourceScholar
2024

Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality

ECCV 2024poster

"Recent Audio-Visual Question Answering (AVQA) methods rely on complete visual and audio input to answer questions accurately. However, in real-world scenarios, issues such as device malfunctions and data transmission errors frequently result in missing audio or visual modality. In such cases, exist…