← Search

Shuyu Wei

1 accepted papers

2025

Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models

ACL 2025finding

Omnimodal Large Language Models (OLLMs) have shown significant progress in integrating vision and text, but still struggle with integrating vision and audio, often exhibiting suboptimal performance when processing audio queries compared to text queries. This disparity is primarily due to insufficien…