2025
HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models
NeurIPS 2025poster
Vision-Language Models (VLMs) have made significant progress in multimodal tasks. However, their performance often deteriorates in long-context scenarios, particularly long videos. While Rotary Position Embedding (RoPE) has been widely adopted for length generalization in Large Language Models (LLMs…