2023
SESCORE2: Learning Text Generation Evaluation via Synthesizing Realistic Mistakes
ACL 2023long
Is it possible to train a general metric for evaluating text generation quality without human-annotated ratings? Existing learned metrics either perform unsatisfactory across text generation tasks or require human ratings for training on specific tasks. In this paper, we propose SEScore2, a self-sup…