2024
DiffSal: Joint Audio and Video Learning for Diffusion Saliency Prediction
CVPR 2024poster
Audio-visual saliency prediction can draw support from diverse modality complements but further performance enhancement is still challenged by customized architectures as well as task-specific loss functions. In recent studies denoising diffusion models have shown more promising in unifying task fra…