← Search

Junfeng Zhan

1 accepted papers

2024

StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation

ACL 2024findings

Evaluation is the baton for the development of large language models. Current evaluations typically employ a single-item assessment paradigm for each atomic test objective, which struggle to discern whether a model genuinely possesses the required capabilities or merely memorizes/guesses the answers…