Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training.
Haowei Liu, Yaya Shi, Haiyang Xu, Chunfeng Yuan, Qinghao Ye, Chenliang Li, Ming Yan, Ji Zhang, Fei Huang, Bing Li, Weiming Hu
Browse the full COLING paper archive.