Skip to content

ScheInfer: Efficient Inference of Large Language Models with Task Scheduling on Moderate GPUs.

Wenxiang Lin, Xinglin Pan, Shaohuai Shi, Xuan Wang, Xiaowen Chu

Year2025
ProceedingsEuro-Par (3)

Browse the full EuroPar paper archive.