2026
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
ICLR 2026poster
Large Language Models have shown impressive generative capabilities across diverse tasks, but their safety remains a critical concern. Existing post-training alignment methods, such as SFT and RLHF, reduce harmful outputs yet leave LLMs vulnerable to jailbreak attacks, especially advanced optimizati…