← Search

Ruoxiang Huang

1 accepted papers

2026

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

CVPR 2026

Vision-Language Models (VLMs) have achieved remarkable progress in multimodal understanding, yet their positional encoding mechanisms remain suboptimal. Existing approaches uniformly assign positional indices to all tokens, overlooking variations in information density within and across modalities,

Cited by 0SourceScholar