2025
Refusal-Aware Red Teaming: Exposing Inconsistency in Safety Evaluations
EMNLP 2025
The responsible deployment of Large Language Models (LLMs) necessitates rigorous safety evaluations. However, a critical challenge arises from inconsistencies between an LLM’s internal refusal decisions and external safety assessments, hindering effective validation. This paper introduces the concep