Skip to content

Taming Latency-Memory Trade-Off in MoE-Based LLM Serving via Fine-Grained Expert Offloading.

Hanfei Yu, Xingqi Cui, Hong Zhang, Hao Wang, Hao Wang

Year2026
ProceedingsEuroSys

Browse the full EuroSys paper archive.