2026
MAGIC: A Co-Evolving Attacker–Defender Adversarial Game for Robust LLM Safety
ICML 2026poster
Ensuring robust safety alignment is crucial for Large Language Models (LLMs), yet existing defenses often lag behind evolving adversarial attacks due to their \textbf{reliance on static, pre-collected data distributions}. In this paper, we introduce \textbf{MAGIC}, a novel multi-turn multi-agent rei…