DocPrune: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
Recent advances in vision-language models have shown strong performance across diverse multimodal tasks, including document question answering that leverages structured visual cues from text, tables, and figures. However, unlike natural images, document images contain large backgrounds and only spar