Vision-text Enhancement Network For Weakly Supervised Video Anomaly Detection
The recent vision-language pre-training model ImageBind has shown significant success in a wide range of visual tasks, demonstrating excellent ability of joint embedding space across different modalities in visual or textual representation. A worthwhile problem is utilizing such a strong model for w…