← Search

Fanrong Ma

1 accepted papers

2024

Improving Cross-Modal Alignment with Synthetic Pairs for Text-Only Image Captioning

AAAI 2024technical

Although image captioning models have made significant advancements in recent years, the majority of them heavily depend on high-quality datasets containing paired images and texts which are costly to acquire. Previous works leverage the CLIP's cross-modal association ability for image captioning, r…

Cited by 11SourcePDFScholar