Skip to content

SpInfer: Leveraging Low-Level Sparsity for Efficient Large Language Model Inference on GPUs.

Ruibo Fan, Xiangrui Yu, Peijie Dong, Zeyu Li, Gu Gong, Qiang Wang, Wei Wang, Xiaowen Chu

Year2025
ProceedingsEuroSys

Browse the full EuroSys paper archive.