2025
Question-Aware Gaussian Experts for Audio-Visual Question Answering
CVPR 2025highlight
Audio-Visual Question Answering (AVQA) requires not only question-based multimodal reasoning but also precise temporal grounding to capture subtle dynamics for accurate prediction. However, existing methods mainly use question information implicitly, limiting focus on question-specific details. Furt…