Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models.
Zhengfeng Lai, Vasileios Saveris, Chen Chen, Hong-You Chen, Haotian Zhang, Bowen Zhang, Wenze Hu, Juan Lao Tebar, Zhe Gan, Peter Grasch, Meng Cao, Yinfei Yang
Browse the full ICLR paper archive.