← Search

Yulong Lin

1 accepted papers

2026

Same Question, Different Lies: Cross-Context Consistency (C³) for Black-Box Sandbagging Detection

ICML 2026poster

As language models grow more capable, accurate capability evaluation becomes essential for safety decisions. If models can deliberately underperform on dangerous capability evaluations---a behavior known as \emph{sandbagging}---they may evade safety measures designed for their true capability level.…

Cited by 0SourceScholar