2025
MUG-Eval: A Proxy Evaluation Framework for Multilingual Generation Capabilities in Any Language
EMNLP 2025
Evaluating text generation capabilities of large language models (LLMs) is challenging, particularly for low-resource languages where methods for direct assessment are scarce. We propose MUG-Eval, a novel framework that evaluates LLMs’ multilingual generation capabilities by transforming existing be