← Search

Mark Cusick

1 accepted papers

2025

DHP Benchmark: Are LLMs Good NLG Evaluators?

NAACL 2025findings

Large Language Models (LLMs) are increasingly serving as evaluators in Natural Language Generation (NLG) tasks; this is often referred to as “LLM-as-a-judge” paradigm. However, the capabilities of LLMs in evaluating NLG quality remain underexplored. Current studies depend on human assessments and si…

Cited by 6SourcePDFScholar