2025
Analogy-based Multi-Turn Jailbreak against Large Language Models
NeurIPS 2025poster
Large language models (LLMs) are inherently designed to support multi-turn interactions, which opens up new possibilities for jailbreak attacks that unfold gradually and potentially bypass safety mechanisms more effectively than single-turn attacks. However, current multi-turn jailbreak methods are…