2025
Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models
ACL 2025finding
Omnimodal Large Language Models (OLLMs) have shown significant progress in integrating vision and text, but still struggle with integrating vision and audio, often exhibiting suboptimal performance when processing audio queries compared to text queries. This disparity is primarily due to insufficien…