2025
Data-Efficient Selection via Grammatical Complexity in Continual Pre-training of Domain-Specific LLMs
EMNLP 2025
Data efficiency is crucial in domain-specific continual pre-training (CPT) of large language models (LLMs), especially under resource constraints. Aiming for “small data, big impact,” this work addresses the limitations of existing domain-specific data selection strategies, which often rely on scarc