Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory
Multi-modal Large Language Models (MLLMs) have achieved remarkable performance across a wide range of visual reasoning tasks, yet their vulnerability to safety risks remains a pressing concern. While prior research primarily focuses on jailbreak defenses that detect and refuse explicitly unsafe inpu