EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval
Text-video retrieval tasks have seen significant improvements due to the recent development of large-scale vision-language pre-trained models. Traditional methods primarily focus on video representations or cross-modal alignment, while recent works shift toward enriching text expressiveness to bette