← Search

Qinjin Jia

1 accepted papers

2023

KG-FLIP: Knowledge-guided Fashion-domain Language-Image Pre-training for E-commerce

ACL 2023industry

Various Vision-Language Pre-training (VLP) models (e.g., CLIP, BLIP) have sprung up and dramatically advanced the benchmarks for public general-domain datasets (e.g., COCO, Flickr30k). Such models usually learn the cross-modal alignment from large-scale well-aligned image-text datasets without lever…

Cited by 11SourcePDFScholar