← Search

Le Hoang Nam

1 accepted papers

2025

SilVar: Speech-Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization

EMNLP 2025

Visual Language Models have demonstrated remarkable capabilities across various tasks, including visual question answering and image captioning. However, most models rely on text-based instructions, limiting their effectiveness in natural human-machine interactions. Moreover, the quality of language

Cited by 0SourcePDFScholar