Spatially-Regularized Entropy for Discriminative Token Merging in Fine-Grained Re-Identification
While Vision Transformers (ViTs) offer strong global modeling, their quadratic computational cost limits utility in latency-sensitive applications like person re-identification (ReID). Existing compression strategies, such as token pruning or generic merging, typically rely on coarse-grained criteri…