Skip to content

ServerlessLLM: Low-Latency Serverless Inference for Large Language Models.

Yao Fu, Leyang Xue, Yeqi Huang, Andrei-Octavian Brabete, Dmitrii Ustiugov, Yuvraj Patel, Luo Mai

VenueA*OSDI
Year2024
ProceedingsOSDI

Browse the full OSDI paper archive.