← Search

Zhuoyun Li

2 accepted papers

2026

Jailbreaking Vision-Language Models Through the Visual Modality

ICML 2026poster

The visual modality of vision-language models (VLMs) is an underexplored attack surface for bypassing safety alignment. We introduce four jailbreak attacks exploiting the vision component: (1) encoding harmful instructions as visual symbol sequences with a decoding legend, (2) replacing harmful obje…

Cited by 0SourceScholar
2026

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

ICLR 2026poster

Spatial reasoning ability is crucial for Vision Language Models (VLMs) to support real-world applications in diverse domains including robotics, augmented reality, and autonomous navigation. Unfortunately, existing benchmarks are inadequate in assessing spatial reasoning ability, especially the \emp…

Cited by 0SourceScholar