2026
Detecting Data Contamination in LLMs via In-Context Learning
ICLR 2026poster
We present Contamination Detection via Context (CoDeC), a practical and accurate method to detect and quantify training data contamination in large language models. CoDeC distinguishes between data memorized during training and data outside the training distribution by measuring how in-context learn…