2024
Can Multiple-choice Questions Really Be Useful in Detecting the Abilities of LLMs?
COLING 2024main
Multiple-choice questions (MCQs) are widely used in the evaluation of large language models (LLMs) due to their simplicity and efficiency. However, there are concerns about whether MCQs can truly measure LLM’s capabilities, particularly in knowledge-intensive scenarios where long-form generation (LF…