← Search

Ahmed El Kholy Faisal Ahmed

1 accepted papers

2020

UNITER: UNiversal Image-TExt Representation Learning

ECCV 2020poster

Joint image-text embedding is the bedrock for most Vision-and-Language (V+L) tasks, where multimodality inputs are simultaneously processed for joint visual and textual understanding. In this paper, we introduce UNITER, a UNiversal Image-TExt Representation, learned through large-scale pre-training…