Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models.
You Li, Heyu Huang, Chi Chen, Kaiyu Huang, Chao Huang, Zonghao Guo, Zhiyuan Liu, Jinan Xu, Yuhua Li, Ruixuan Li, Maosong Sun
Browse the full ACL paper archive.