2024
StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation
ACL 2024findings
Evaluation is the baton for the development of large language models. Current evaluations typically employ a single-item assessment paradigm for each atomic test objective, which struggle to discern whether a model genuinely possesses the required capabilities or merely memorizes/guesses the answers…