Taming Latency-Memory Trade-Off in MoE-Based LLM Serving via Fine-Grained Expert Offloading.
Hanfei Yu, Xingqi Cui, Hong Zhang, Hao Wang, Hao Wang
Browse the full EuroSys paper archive.
Hanfei Yu, Xingqi Cui, Hong Zhang, Hao Wang, Hao Wang
Browse the full EuroSys paper archive.