2026
Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers
ICML 2026oral
Large language model (LLM) activations are notoriously difficult to understand, with most existing techniques using complex, specialized methods for interpreting them. Recent work has proposed a simpler approach known as LatentQA: training LLMs to directly accept LLM activations as inputs and answer…