2026
Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors
CVPR 2026
Vision Transformer (ViT)-based sparse multi-view 3D object detectors have achieved remarkable accuracy but still suffer from high inference latency due to heavy token processing. To accelerate these models, token compression has been widely explored. However, our revisit of existing strategies, such