GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models.
Shurong Zheng, Yousong Zhu, Hongyin Zhao, Fan Yang, Yufei Zhan, Ming Tang, Jinqiao Wang
Browse the full AAAI paper archive.
Shurong Zheng, Yousong Zhu, Hongyin Zhao, Fan Yang, Yufei Zhan, Ming Tang, Jinqiao Wang
Browse the full AAAI paper archive.