← Search

Zi-Hao Bo

2 accepted papers

2026

LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models

ICLR 2026poster

Vision-Language Models (VLMs) have recently demonstrated remarkable capabilities in visual understanding and reasoning, but they also impose significant computational burdens due to long visual sequence inputs. Recent works address this issue by pruning unimportant visual tokens, achieving substanti…

Cited by 0SourcecodeScholar
2026

Soft Modality-Guided Expert Specialization in MoE-VLMs

CVPR 2026

Mixture-of-Experts (MoE) has become a prevalent backbone for large vision-language models (VLMs), yet how modality-specific signals should guide expert routing remains under-explored. Existing routing strategies are either hand-crafted or modality-agnostic, relying on idealized priors that ignore th

Cited by 0SourceScholar