EMNLP 2023short findings0 citations

Data Selection Curriculum for Abstractive Text Summarization

Shichao Sun, Ruifeng Yuan, Jianfei He, Ziqiang Cao, Wenjie Li, Xiaohua Jia

Abstract

Abstractive Text Summarization (ATS) models are commonly trained using large-scale data that is randomly shuffled. However, the impact of data selection and data ordering on ATS models remains a relatively unexplored research area, where a significant challenge lies in accurately assessing the learning difficulty of each training instance. This study introduces a Data Selection Curriculum (DSC) scoring system that incorporates both the difficulty of improving ATS model via an instance and the expected performance on this instance. By selectively excluding excessively simple and overly complex instances, the training efficiency can be optimized. Furthermore, curriculum learning is integrated to accelerate convergence and improve performance by gradually increasing the learning difficulty, inspired by human learners. Experimental results on the CNN/DailyMail dataset demonstrate that our approach surpasses potent baselines, utilizing a mere 20\% of the available instances.

Data SelectionCurriculum LearningAbstractive Text Summarization
BibTeX
@inproceedings{
sun2023data,
title={Data Selection Curriculum for Abstractive Text Summarization},
author={Shichao Sun and Ruifeng Yuan and Jianfei He and Ziqiang Cao and Wenjie Li and Xiaohua Jia},
booktitle={The 2023 Conference on Empirical Methods in Natural Language Processing},
year={2023},
url={https://openreview.net/forum?id=VQQeyiAqtv}
}
Data Selection Curriculum for Abstractive Text Summarization · EMNLP 2023