2026
Condensed Test-Time Adaptation of VLMs for Action Recognition
CVPR 2026
Test-time adaptation for video understanding, which enables vision-language models (VLMs) to generalize to downstream tasks such as action recognition, has demonstrated substantial value in real-world applications. Existing memory-based methods typically build a visual cache from high-confidence tes