← Search

Henghui Du

2 accepted papers

2025

Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation

CVPR 2025poster

In recent years, numerous tasks have been proposed to encourage model to develop specified capability in understanding audio-visual scene, primarily categorized into temporal localization, spatial localization, spatio-temporal reasoning, and pixel-level understanding. Instead, human possesses a unif…