← Search

Patrick Mendoza

1 accepted papers

2026

GradShield: Alignment Preserving Finetuning

ICLR 2026poster

Large Language Models (LLMs) pose a significant risk of safety misalignment after finetuning, as models can be compromised by both explicitly and implicitly harmful data. Even some seemingly benign data can inadvertently steer a model towards unsafe behaviors. To address this, we introduce GradShiel…

Cited by 0SourceScholar