2025
Spatiotemporal-Aware Visual Captioning using Vision-Language Pre-Training Model
ICASSP 2025accepted
Current visual captioning technologies typically transform 3D/2D visual information into one-dimensional sequential data and employ language models to generate corresponding descriptions. This approach, however, compromises the spatiotemporal information in visual data, making it difficult for model…