2024
TurkishMMLU: Measuring Massive Multitask Language Understanding in Turkish
EMNLP 2024finding
Multiple choice question answering tasks evaluate the reasoning, comprehension, and mathematical abilities of Large Language Models (LLMs). While existing benchmarks employ automatic translation for multilingual evaluation, this approach is error-prone and potentially introduces culturally biased qu…