2025
MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation
EMNLP 2025
Existing large language model (LLM) evaluation benchmarks primarily focus on English, while current multilingual tasks lack parallel questions that specifically assess cross-lingual reasoning abilities. This dual limitation makes it challenging to assess LLMs’ performance in the multilingual setting