← Search

Henk Tillman

1 accepted papers

2025

Scaling and evaluating sparse autoencoders

ICLR 2025oral

Sparse autoencoders provide a promising unsupervised approach for extracting interpretable features from a language model by reconstructing activations from a sparse bottleneck layer. Since language models learn many concepts, autoencoders need to be very large to recover all relevant features. Howe…