2025
SilVar: Speech-Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
EMNLP 2025
Visual Language Models have demonstrated remarkable capabilities across various tasks, including visual question answering and image captioning. However, most models rely on text-based instructions, limiting their effectiveness in natural human-machine interactions. Moreover, the quality of language