2023
Audio-Visual Speaker Diarization in the Framework of Multi-User Human-Robot Interaction
ICASSP 2023accepted
The speaker diarization task answers the question "who is speaking at a given time?". It represents valuable information for scene analysis in a domain such as robotics. In this paper, we introduce a temporal audio-visual fusion model for multiusers speaker diarization, with low computing requiremen…