2026
Same Question, Different Lies: Cross-Context Consistency (C³) for Black-Box Sandbagging Detection
ICML 2026poster
As language models grow more capable, accurate capability evaluation becomes essential for safety decisions. If models can deliberately underperform on dangerous capability evaluations---a behavior known as \emph{sandbagging}---they may evade safety measures designed for their true capability level.…