HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference.
Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li
Browse the full ACL paper archive.
Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li
Browse the full ACL paper archive.