| 2026 | HPCA | ELORA: Efficient LoRA and KV Cache Management for Multi-LoRA LLM Serving. | Jiuchen Shi, Hang Zhang, Yixiao Wang, Quan Chen, Yizhou Shan, Kaihua Fu, Wei Wang, Minyi Guo |
| 2025 | CLOUD | FaaSGNN: Enabling Memory Efficient and Low Latency GNN Inference Services with Serverless Computing. | Yuzhuo Yang, Kaihua Fu, Quan Chen, Deze Zeng, Shuo Quan, Jie Wu, Minyi Guo |
| 2023 | SC | BLAD: Adaptive Load Balanced Scheduling and Operator Overlap Pipeline For Accelerating The Dynamic GNN Training. | Kaihua Fu, Quan Chen, Yuzhuo Yang, Jiuchen Shi, Chao Li, Minyi Guo |
| 2023 | USENIX | Nodens: Enabling Resource Efficient and Fast QoS Recovery of Dynamic Microservice Applications in Datacenters. | Jiuchen Shi, Hang Zhang, Zhixin Tong, Quan Chen, Kaihua Fu, Minyi Guo |
| 2022 | ASPLOS | Astraea: towards QoS-aware and resource-efficient multi-stage GPU services. | Wei Zhang, Quan Chen, Kaihua Fu, Ningxin Zheng, Zhiyi Huang, Jingwen Leng, Minyi Guo |
| 2022 | CLOUD | Characterizing and orchestrating VM reservation in geo-distributed clouds to improve the resource efficiency. | Jiuchen Shi, Kaihua Fu, Quan Chen, Changpeng Yang, Pengfei Huang, Mosong Zhou, Jieru Zhao, Chen Chen, Minyi Guo |
| 2022 | SC | QoS-Aware Irregular Collaborative Inference for Improving Throughput of DNN Services. | Kaihua Fu, Jiuchen Shi, Quan Chen, Ningxin Zheng, Wei Zhang, Deze Zeng, Minyi Guo |
| 2021 | ICCD | CHARM: Collaborative Host and Accelerator Resource Management for GPU Datacenters. | Wei Zhang, Kaihua Fu, Ningxin Zheng, Quan Chen, Chao Li, Wenli Zheng, Minyi Guo |
| 2019 | ICS | Laius: Towards latency awareness and improved utilization of spatial multitasking accelerators in datacenters. | Wei Zhang, Weihao Cui, Kaihua Fu, Quan Chen, Daniel Edward Mawhirter, Bo Wu, Chao Li, Minyi Guo |