| 2026 | EuroSys | FlexPipe: Adapting Dynamic LLM Serving Through Inflight Pipeline Refactoring in Fragmented Serverless Clusters. | Yanying Lin, Shijie Peng, Chengzhi Lu, ChengZhong Xu, Kejiang Ye |
| 2025 | CLUSTER | Rock: Serving Multimodal Models in Cloud with Heterogeneous-Aware Resource Orchestration for Thousands of LoRA Adapters. | Shuaipeng Wu, Yanying Lin, Shijie Peng, Wenyan Chen, Chong Ma, Min Shen, Le Chen, Chengzhong Xu, Kejiang Ye |
| 2024 | CSCWD | EINS: Edge-Cloud Deep Model Inference with Network-Efficiency Schedule in Serverless. | Shijie Peng, Yanying Lin, Wenyan Chen, Yingfei Tang, Xu Duan, Kejiang Ye |
| 2024 | ICDCS | QUART: Latency-Aware FaaS System for Pipelining Large Model Inference. | Yanying Lin, Yanbo Li, Shijie Peng, Yingfei Tang, Shutian Luo, Haiying Shen, Cheng-Zhong Xu, Kejiang Ye |
| 2024 | ICWS | Planck: Optimizing LLM Inference Performance in Pipeline Parallelism with Fine-Grained SLO Constraint. | Yanying Lin, Shijie Peng, Shuaipeng Wu, Yanbo Li, Chengzhi Lu, Chengzhong Xu, Kejiang Ye |
| 2023 | ICPADS | FLASH: Low-Latency Serverless Model Inference with Multi-Core Parallelism in Edge. | Yanbo Li, Yanying Lin, Shijie Peng, Yingfei Tang, Tian Xiang, Wei Song, Kejiang Ye |