2026
Enhancing Stability and Fidelity for Zero-Shot TTS with a Multi-Level Evaluator
AAAI 2026technical
Recent advances in zero-shot text-to-speech (TTS), driven by language models, diffusion models and masked generation, have achieved impressive naturalness in speech synthesis. Nevertheless, stability and fidelity remain key challenges, manifesting as mispronunciations, audible noise, and quality deg