2025
Do Slides Help? Multi-modal Context for Automatic Transcription of Conference Talks
EMNLP 2025
State-of-the-art (SOTA) Automatic Speech Recognition (ASR) systems primarily rely on acoustic information while disregarding additional multi-modal context. However, visual information are essential in disambiguation and adaptation. While most work focus on speaker images to handle noise conditions,