Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction.
Shiyu Zhao, Zhenting Wang, Felix Juefei-Xu, Xide Xia, Miao Liu, Xiaofang Wang, Mingfu Liang, Ning Zhang, Dimitris N. Metaxas, Licheng Yu
Browse the full CVPR paper archive.