2025
Retracing the Past: LLMs Emit Training Data When They Get Lost
EMNLP 2025
The memorization of training data in large language models (LLMs) poses significant privacy and copyright concerns. Existing data extraction methods, particularly heuristic-based divergence attacks, often exhibit limited success and offer limited insight into the fundamental drivers of memorization