← Search

Byung-Hak Kim

2 accepted papers

2025

Agent-as-Judge for Factual Summarization of Long Narratives

EMNLP 2025

Large Language Models (LLMs) have demonstrated near-human performance in summarization tasks based on traditional metrics such as ROUGE and BERTScore. However, these metrics do not adequately capture critical aspects of summarization quality, such as factual accuracy, particularly for long narrative