2025
Language-Queried Target Sound Extraction Without Parallel Training Data
ICASSP 2025accepted
Language-queried target sound extraction (TSE) aims to extract specific sounds from mixtures based on language queries. Traditional fully-supervised training schemes require extensively annotated parallel audio-text data, which are labor-intensive. We introduce a parallel-data-free training scheme,…