SlimInfer: Accelerating Long-Context LLM Inference via Dynamic Token Pruning.
Lingkun Long, Rubing Yang, Yushi Huang, Desheng Hui, Ao Zhou, Jianlei Yang
Browse the full AAAI paper archive.
Lingkun Long, Rubing Yang, Yushi Huang, Desheng Hui, Ao Zhou, Jianlei Yang
Browse the full AAAI paper archive.