2024
Multi-Modality Speech Recognition Driven by Background Visual Scenes
ICASSP 2024accepted
Visual information is often used as a complementary cue for automatic speech recognition in noisy environments. Most previous studies utilize visual information of target speakers (e.g., lip movements) to improve the recognition performance of audio-visual speech recognition (AVSR) models. However,…