2026
Explaining Jailbreaks: Structured and Interpretable Safety Assessment for Large Language Models
IJCAI 2026
Large Language Models (LLMs) remain highly vulnerable to jailbreak attacks, yet existing evaluations rely primarily on outcome-level metrics such as Attack Success Rate (ASR), providing limited insight into how and why safety failures occur. We propose an explanation-aware safety framework that augm