2026
Temporal Calibrating and Distilling for Scene-Text Aware Text-Video Retrieval
AAAI 2026technical
Existing text-video retrieval methods mainly focus on singlemodal video content (i.e., visual entities), often overlooking heterogeneous scene text that is ubiquitous in human environments. Although scene text in videos provides finegrained semantics for cross-modal retrieval, effectively utilizing