2025
CoBia: Constructed Conversations Can Trigger Otherwise Concealed Societal Biases in LLMs
EMNLP 2025
Improvements in model construction, including fortified safety guardrails, allow Large language models (LLMs) to increasingly pass standard safety checks. However, LLMs sometimes slip into revealing harmful behavior, such as expressing racist viewpoints, during conversations. To analyze this systema