AAAI 2026technical0 citations

Dynamic Deep Prompt Optimization for Defending Against Jailbreak Attacks on LLMs

Doniyorkhon Obidov, Honggang Yu, Xiaolong Guo, Kaichen Yang

Abstract

Large Language Models (LLMs) demonstrate impressive capabilities across many applications but remain vulnerable to jailbreak attacks, which elicit harmful or unintended content. While model fine-tuning is an option for safety alignment, it is costly and prone to catastrophic forgetting. Prompt optimization has emerged as a promising alternative, yet existing prompt-based defenses typically rely on static modifications (e.g., fixed prefixes or suffixes) that cannot adapt to diverse and evolving attacks. We propose Dynamic Deep Prompt Optimization (DDPO), the first jailbreak defense based on deep prompt optimization. DDPO uses the target LLM

BibTeX
@inproceedings{aaai2026_dynamicdeeppromp,
  title = {Dynamic Deep Prompt Optimization for Defending Against Jailbreak Attacks on LLMs},
  author = {Doniyorkhon Obidov and Honggang Yu and Xiaolong Guo and Kaichen Yang},
  booktitle = {AAAI 2026},
  year = {2026}
}