| 2026 | EuroSys | Efficient Data Passing for Serverless Inference Workflows: A GPU-Centric Approach. | Hao Wu, Yaochen Liu, Minchen Yu, Qizhen Weng, Junxiao Deng, Yue Yu, Hao Fan, Song Wu, Wei Wang, Hai Jin |
| 2026 | IWQoS | ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing. | Kaiwen Chen, Xin Tan, Minchen Yu, Jingzong Li, Hong Xu |
| 2025 | CLOUD | AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving. | Kaiyu Huang, Hao Wu, Zhubo Shi, Han Zou, Minchen Yu, Qingjiang Shi |
| 2025 | USENIX | Toppings: CPU-Assisted, Rank-Aware Adapter Serving for LLM Inference. | Suyi Li, Hanfeng Lu, Tianyuan Wu, Minchen Yu, Qizhen Weng, Xusheng Chen, Yizhou Shan, Binhang Yuan, Wei Wang |
| 2025 | USENIX | Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference. | Minchen Yu, Ao Wang, Dong Chen, Haoxuan Yu, Xiaonan Luo, Zhuohao Li, Wei Wang, Ruichuan Chen, Dapeng Nie, Haoran Yang, Yu Ding |
| 2023 | NSDI | Following the Data, Not the Function: Rethinking Function Orchestration in Serverless Computing. | Minchen Yu, Tingjia Cao, Wei Wang, Ruichuan Chen |
| 2021 | ICDCS | Gillis: Serving Large Neural Networks in Serverless Functions with Automatic Model Partitioning. | Minchen Yu, Zhifeng Jiang, Hok Chun Ng, Wei Wang, Ruichuan Chen, Bo Li |
| 2021 | USENIX | CrystalPerf: Learning to Characterize the Performance of Dataflow Computation through Code Analysis. | Huangshi Tian, Minchen Yu, Wei Wang |
| 2020 | INFOCOM | RepBun: Load-Balanced, Shuffle-Free Cluster Caching for Structured Data. | Minchen Yu, Yinghao Yu, Yunchuan Zheng, Baichen Yang, Wei Wang |
| 2019 | USENIX | MArk: Exploiting Cloud Services for Cost-Effective, SLO-Aware Machine Learning Inference Serving. | Chengliang Zhang, Minchen Yu, Wei Wang, Feng Yan |
| 2018 | CLOUD | Continuum: A Platform for Cost-Aware, Low-Latency Continual Learning. | Huangshi Tian, Minchen Yu, Wei Wang |