AVAM: A Universal Training-Free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-Image Question Answering.
Kang Zeng, Guojin Zhong, Jintao Cheng, Jin Yuan, Zhiyong Li
Browse the full ICCV paper archive.
Kang Zeng, Guojin Zhong, Jintao Cheng, Jin Yuan, Zhiyong Li
Browse the full ICCV paper archive.