2026
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
CVPR 2026
Vision-Language Models (VLMs) have achieved remarkable progress in multimodal understanding, yet their positional encoding mechanisms remain suboptimal. Existing approaches uniformly assign positional indices to all tokens, overlooking variations in information density within and across modalities,