ST3: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming.
Jiedong Zhuang, Lu Lu, Ming Dai, Rui Hu, Jian Chen, Qiang Liu, Haoji Hu
Browse the full AAAI paper archive.
Jiedong Zhuang, Lu Lu, Ming Dai, Rui Hu, Jian Chen, Qiang Liu, Haoji Hu
Browse the full AAAI paper archive.