Skip to content

GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models.

Shurong Zheng, Yousong Zhu, Hongyin Zhao, Fan Yang, Yufei Zhan, Ming Tang, Jinqiao Wang

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.