2025
Fine-tuning can Help Detect Pretraining Data from Large Language Models
ICLR 2025poster
In the era of large language models (LLMs), detecting pretraining data has been increasingly important due to concerns about fair evaluation and ethical risks. Current methods differentiate members and non-members by designing scoring functions, like Perplexity and Min-k%. However, the diversity and…