← Search

Joo Bon Maeng

1 accepted papers

2025

Goal-Conditioned DPO: Prioritizing Safety in Misaligned Instructions

NAACL 2025long

Large language models (LLMs) undergo extensive safety training to maximize both helpfulness and harmlessness in their responses. However, various jailbreak attacks jeopardize model safety, allowing malicious actors to bypass safety guidelines. Existing defense methods primarily focus on aligning the…

Cited by 0SourcePDFScholar