FlexLLM: Token-Level Co-Serving of LLM Inference and Finetuning with SLO Guarantees.
Gabriele Oliaro, Xupeng Miao, Xinhao Cheng, Vineeth Kada, Mengdi Wu, Ruohan Gao, Yingyi Huang, Remi Delacourt, April Yang, Yingcheng Wang, Colin Unger, Zhihao Jia
Browse the full NSDI paper archive.