Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models.
Chuofan Ma, Yi Jiang, Jiannan Wu, Zehuan Yuan, Xiaojuan Qi
Browse the full ECCV paper archive.
Chuofan Ma, Yi Jiang, Jiannan Wu, Zehuan Yuan, Xiaojuan Qi
Browse the full ECCV paper archive.