2023
The Diminishing Returns of Masked Language Models to Science
ACL 2023findings
Transformer-based masked language models such as BERT, trained on general corpora, have shown impressive performance on downstream tasks. It has also been demonstrated that the downstream task performance of such models can be improved by pretraining larger models for longer on more data. In this wo…