2024
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
AAAI 2024technical
Recently, there has been growing interest in using Large Language Models (LLMs) for scientific research. Numerous benchmarks have been proposed to evaluate the ability of LLMs for scientific research. However, current benchmarks are mostly based on pre-collected objective questions. This design suff…