2026
WALKSAFE: Risk-aware Graph Random Walk with Bi-GRPO for LLM Safety
AAAI 2026technical
Large language models (LLMs) may generate harmful outputs on malicious inputs. Existing safety methods, including prompt engineering and model editing, rely on hand-crafted templates or target-driven parameter modifications, limiting their generalizability in unseen harmful scenarios. Post-training