Locale Encoding for Scalable Multilingual Keyword Spotting Models
Pai Zhu, Hyun Jin Park, Alex Park, Angelo Scorza Scarpati, Ignacio López-Moreno
Abstract
A Multilingual Keyword Spotting (KWS) system detects spoken keywords over multiple locales. Conventional monolingual KWS approaches do not scale well to multilingual scenarios because of high development/maintenance costs and lack of resource sharing. To overcome this limit, we propose two locale-conditioned universal models with locale feature concatenation and feature-wise linear modulation (FiLM). We compare these models with two baseline methods: locale-specific monolingual KWS, and a single universal model trained over all data. Experiments over 10 localized language datasets show that locale-conditioned models substantially improve accuracy over baseline methods across all locales in different noise conditions. FiLM performed the best, improving on average FRR by 61% (relative) compared to monolingual KWS models of similar sizes.
BibTeX
@inproceedings{icassp2023_localeencodingfo,
title = {Locale Encoding for Scalable Multilingual Keyword Spotting Models},
author = {Pai Zhu and Hyun Jin Park and Alex Park and Angelo Scorza Scarpati and Ignacio López-Moreno},
booktitle = {ICASSP 2023},
year = {2023}
}