2025
Optimising Factual Consistency in Summarisation via Preference Learning from Multiple Imperfect Metrics
EMNLP 2025
Reinforcement learning with evaluation metrics as rewards is widely used to enhance specific capabilities of language models. However, for tasks such as factually consistent summarisation, existing metrics remain underdeveloped, limiting their effectiveness as signals for shaping model behaviour.Whi