MAMO: Fine-Grained Vision-Language Representations Learning with Masked Multimodal Modeling.
Zijia Zhao, Longteng Guo, Xingjian He, Shuai Shao, Zehuan Yuan, Jing Liu
Browse the full SIGIR paper archive.
Zijia Zhao, Longteng Guo, Xingjian He, Shuai Shao, Zehuan Yuan, Jing Liu
Browse the full SIGIR paper archive.