2026
Mitigating Content Effects on Reasoning in Language Models Through Fine-Grained Activation Steering
AAAI 2026technical
Large language models (LLMs) exhibit reasoning biases, often conflating content plausibility with formal logical validity. This can lead to wrong inferences in critical domains, where plausible arguments are incorrectly deemed logically valid or vice versa. This paper investigates how content biases