← Search

Rong Fan

2 accepted papers

2026

GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

CVPR 2026

Video temporal grounding (VTG) is a critical task in video understanding and a key capability for extending video large language models (Vid-LLMs) to broader applications. However, existing Vid-LLMs rely on uniform frame sampling to extract video information, resulting in a sparse distribution of ke

Cited by 0SourcecodeScholar
2026

MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention

AAAI 2026technical

Vision large language models (VLLMs) are focusing primarily on handling complex and fine-grained visual information by incorporating advanced vision encoders and scaling up visual models. However, these approaches face high training and inference costs, as well as challenges in extracting visual det

Cited by 0SourcePDFScholar