OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models
Emerging Omni-modal Large Language Models (OmniLLMs) enable real-time interaction across video, audio, and text but suffer from prohibitive computational costs due to the quadratic complexity of processing continuous streaming inputs. Existing token compression strategies remain suboptimal as they t…