FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models.
Tianyu Fu, Tengxuan Liu, Qinghao Han, Guohao Dai, Shengen Yan, Huazhong Yang, Xuefei Ning, Yu Wang
Browse the full ICCV paper archive.
Tianyu Fu, Tengxuan Liu, Qinghao Han, Guohao Dai, Shengen Yan, Huazhong Yang, Xuefei Ning, Yu Wang
Browse the full ICCV paper archive.