2026
UVU: Improving Multimodal Understanding via Vision-Language Unified Autoregressive Paradigm
CVPR 2026
Despite remarkable advancements in multimodal large language models (MLLMs), their fine-grained visual understanding is constrained by a primary reliance on sparse textual supervision. Existing efforts to introduce visual supervision typically do so during post-training, when visual representations