← Search

Hongyi Tang

1 accepted papers

2025

Identifying Pre-training Data in LLMs: A Neuron Activation-Based Detection Framework

EMNLP 2025

The performance of large language models (LLMs) is closely tied to their training data, which can include copyrighted material or private information, raising legal and ethical concerns. Additionally, LLMs face criticism for dataset contamination and internalizing biases. To address these issues, th