2025
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
ICML 2025poster
In vision-language models (VLMs), visual tokens usually consume a significant amount of computational overhead, despite their sparser information density compared to text tokens. To address this, most existing methods learn a network to prune redundant visual tokens and require additional training d…