← Search

Thomas Heap

3 accepted papers

2026

Automated Interpretability Metrics Do Not Distinguish Trained and Random Transformers

ICLR 2026poster

Sparse autoencoders (SAEs) are widely used to extract sparse, interpretable latents from transformer activations. We test whether commonly used SAE quality metrics and automatic explanation pipelines can distinguish trained transformers from randomly initialized ones (e.g., where parameters are samp…

Cited by 0SourceScholar
2024

Using Autodiff to Estimate Posterior Moments, Marginals and Samples

UAI 2024poster

Importance sampling is a popular technique in Bayesian inference: by reweighting samples drawn from a proposal distribution we are able to obtain samples and moment estimates from a Bayesian posterior over latent variables. Recent work, however, indicates that importance sampling scales poorly — in…