Skip to content

MAMO: Fine-Grained Vision-Language Representations Learning with Masked Multimodal Modeling.

Zijia Zhao, Longteng Guo, Xingjian He, Shuai Shao, Zehuan Yuan, Jing Liu

VenueA*SIGIR
Year2023
ProceedingsSIGIR

Browse the full SIGIR paper archive.