Efficient Long Document Ranking via Adaptive Token Pruning with Query-Document Alignment
Transformer-based models have achieved great success in document ranking, yet they suffer from substantial computational costs due to the quadratic complexity of attention, particularly for Long Document Ranking (LDR). Token pruning is a promising approach to reducing computational costs, while exis…