← Search

Clemens Vetter

1 accepted papers

2026

In-Training Defenses Against Emergent Misalignment in Language Models

ICML 2026poster

Fine‑tuning lets practitioners repurpose aligned large language models (LLMs) for new domains, yet recent work reveals emergent misalignment (EMA): Even a small, domain‑specific fine‑tune can induce harmful behaviors far outside the target domain. Even in the case where model weights are hidden behi…

Cited by 0SourceScholar