2025
Language Models Lack Temporal Generalization and Bigger is Not Better
ACL 2025finding
This paper presents elaborate testing of various LLMs on their generalization capacities. We finetune six encoder models that have been pretrained with very different data (varying in size, language, and period) on a challenging event detection task in Early Modern Dutch archival texts. Each model i…