2026
Cross-Modal Bottleneck Fusion for Noise Robust Audio-Visual Speech Recognition
ICASSP 2026poster
Audio-Visual Speech Recognition (AVSR) leverages both acoustic and visual cues to improve speech recognition under noisy conditions. A central question is how to design a fusion mechanism that allows the model to effectively exploit visual information when the audio signal is degraded, while maintai…