Skip to content

Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models.

Chuofan Ma, Yi Jiang, Jiannan Wu, Zehuan Yuan, Xiaojuan Qi

VenueA*ECCV
Year2024
ProceedingsECCV (6)

Browse the full ECCV paper archive.