ScheInfer: Efficient Inference of Large Language Models with Task Scheduling on Moderate GPUs.
Wenxiang Lin, Xinglin Pan, Shaohuai Shi, Xuan Wang, Xiaowen Chu
Browse the full EuroPar paper archive.
Wenxiang Lin, Xinglin Pan, Shaohuai Shi, Xuan Wang, Xiaowen Chu
Browse the full EuroPar paper archive.