Leveraging per Image-Token Consistency for Vision-Language Pre-training.
Yunhao Gou, Tom Ko, Hansi Yang, James T. Kwok, Yu Zhang, Mingxuan Wang
Browse the full CVPR paper archive.
Yunhao Gou, Tom Ko, Hansi Yang, James T. Kwok, Yu Zhang, Mingxuan Wang
Browse the full CVPR paper archive.