2026
Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering
ICLR 2026poster
Audio–Visual Question Answering (AVQA) is a challenging multimodal task that requires jointly reasoning over audio, visual, and textual information in a given video to answer natural language questions. Inspired by recent advances in Video QA, many existing AVQA approaches primarily focus on visual…