← Search

Hairong Zheng

1 accepted papers

2026

ApET: Approximation-Error Guided Token Compression for Efficient VLMs

CVPR 2026

Recent Vision-Language Models (VLMs) have demonstrated remarkable multimodal understanding capabilities, yet the redundant visual tokens incur prohibitive computational overhead and degrade inference efficiency. Prior studies typically relies on [CLS] attention or text-vision cross-attention to iden

Cited by 0SourcecodeScholar