2025
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
ACL 2025finding
Large language models (LLMs) have made significant advancements across various tasks, but their safety alignment remains a major concern. Exploring jailbreak prompts can expose LLMs’ vulnerabilities and guide efforts to secure them. Existing methods primarily design sophisticated instructions for th…