AAAI 2026technical0 citations
Dynamic Deep Prompt Optimization for Defending Against Jailbreak Attacks on LLMs
Doniyorkhon Obidov, Honggang Yu, Xiaolong Guo, Kaichen Yang
Abstract
Large Language Models (LLMs) demonstrate impressive capabilities across many applications but remain vulnerable to jailbreak attacks, which elicit harmful or unintended content. While model fine-tuning is an option for safety alignment, it is costly and prone to catastrophic forgetting. Prompt optimization has emerged as a promising alternative, yet existing prompt-based defenses typically rely on static modifications (e.g., fixed prefixes or suffixes) that cannot adapt to diverse and evolving attacks. We propose Dynamic Deep Prompt Optimization (DDPO), the first jailbreak defense based on deep prompt optimization. DDPO uses the target LLM
BibTeX
@inproceedings{aaai2026_dynamicdeeppromp,
title = {Dynamic Deep Prompt Optimization for Defending Against Jailbreak Attacks on LLMs},
author = {Doniyorkhon Obidov and Honggang Yu and Xiaolong Guo and Kaichen Yang},
booktitle = {AAAI 2026},
year = {2026}
}