2026
OCR-Enhanced Multimodal ASR Can Read While Listening
ICASSP 2026poster
Visual information, such as subtitles in a movie, often helps automatic speech recognition. In this paper, we propose Donut-Whisper, an audio-visual ASR model with dual encoder to leverage visual information to improve speech recognition performance in both English and Chinese. Donut-Whisper combine…