2025
SaMer: A Scenario-aware Multi-dimensional Evaluator for Large Language Models
ICLR 2025poster
Evaluating the response quality of large language models (LLMs) for open-ended questions poses a significant challenge, especially given the subjectivity and multi-dimensionality of "quality" in natural language generation. Existing LLM evaluators often neglect that different scenarios require disti…