2026
Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control
ICML 2026poster
Safety alignment remains brittle under domain shift and noisy preference supervision. Existing robust alignment methods predominantly focus on data uncertainty in alignment data, while being less effective at addressing failures caused by optimization-induced fragility. In this work, we revisit robu…