2026
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
ICML 2026poster
Red teaming is critical for uncovering vulnerabilities in Large Language Models (LLMs). While automated methods have improved scalability, existing approaches often rely on static heuristics or stochastic search, rendering them brittle against advanced safety alignment. To address this, we introduce…