English as Defense Proxy: Mitigating Multilingual Jailbreak via Eliciting English Safety Knowledge
Large language models (LLMs) excel in many tasks, but their safety guarantees vary by language, e.g., responses in English tend to be safer than those in low-resource languages. This inconsistency creates a vulnerability, since an attacker can circumvent safety measures by using a less-supported lan