2023
Wukong-Reader: Multi-modal Pre-training for Fine-grained Visual Document Understanding
ACL 2023long
Unsupervised pre-training on millions of digital-born or scanned documents has shown promising advances in visual document understanding (VDU). While various vision-language pre-training objectives are studied in existing solutions, the document textline, as an intrinsic granularity in VDU, has seld…