2021
OpenMEVA: A Benchmark for Evaluating Open-ended Story Generation Metrics
ACL 2021long
Automatic metrics are essential for developing natural language generation (NLG) models, particularly for open-ended language generation tasks such as story generation. However, existing automatic metrics are observed to correlate poorly with human evaluation. The lack of standardized benchmark data…