← Search

Lai Xu

2 accepted papers

2025

HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models

NeurIPS 2025poster

Vision-Language Models (VLMs) have made significant progress in multimodal tasks. However, their performance often deteriorates in long-context scenarios, particularly long videos. While Rotary Position Embedding (RoPE) has been widely adopted for length generalization in Large Language Models (LLMs…

Cited by 0SourceScholar