← Search

Sami Sebastian Brandt

1 accepted papers

2026

Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering

ICLR 2026poster

Audio–Visual Question Answering (AVQA) is a challenging multimodal task that requires jointly reasoning over audio, visual, and textual information in a given video to answer natural language questions. Inspired by recent advances in Video QA, many existing AVQA approaches primarily focus on visual…

Cited by 0SourcecodeScholar