HookMoE: A learnable performance compensation strategy of Mixture-of-Experts for LLM inference acceleration.
Longkai Cheng, Along He, Mulin Li, Xueshuo Xie, Tao Li
Browse the full EMNLP paper archive.
Longkai Cheng, Along He, Mulin Li, Xueshuo Xie, Tao Li
Browse the full EMNLP paper archive.