| 2026 | EuroPar | DAG-P: Efficient Fine-Grained Partitioning of Open-Source Transformer Models via Dependency-Aligned Planning. | Chenke Yi, Zhiquan Lai, Shengwei Li, Wei Wang, Yu Tang, Weijie Liu, Dongsheng Li |
| 2026 | FAST | AdaCheck: An Adaptive Checkpointing System for Efficient LLM Training with Redundancy Utilization. | Weijie Liu, Shengwei Li, Zhiquan Lai, Keshi Ge, Qiaoling Chen, Peng Sun, Dongsheng Li, Kai Lu |
| 2026 | NSDI | Di-PS: System-Algorithm Co-Design for Asynchronous and Heterogeneous Cross-cluster LLM Training at Scale. | Shengwei Li, Qiaoling Chen, Zhiquan Lai, Penglong Jiao, Wenwen Qu, Kun Cai, Jiaxing Li, Peng Sun, Xingcheng Zhang, Xiaoge Deng, Dongsheng Li, Kai Lu, Tianwei Zhang |
| 2025 | CLUSTER | Capricorn: Efficient In-Memory Checkpointing for MoE Model Training with Dynamicity Awareness. | Wenqian Xie, Zhiquan Lai, Shengwei Li, Weijie Liu, Wei Wang, Yanqi Hao, Dongsheng Li |
| 2025 | ICA3PP | EAHP: An Efficient Automatic Hybrid Parallelism Approach with Genetic Algorithm. | Yichen Gu, Zhiquan Lai, Weijie Liu, Yinghui Gao |
| 2025 | ICPP | HMGraph: Boosting GNN Training on Hierarchical Memory via Coordinated Cache. | Lizhi Zhang, Menghan Jia, Zhiquan Lai, Qiao Li, Yiming Zhang, Dongsheng Li |
| 2024 | ICDE | Hierarchical Adaptive Pooling by Capturing High-order Dependency for Graph Representation Learning (Extended Abstract). | Ning Liu, Songlei Jian, Dongsheng Li, Yiming Zhang, Zhiquan Lai, Hongzuo Xu |
| 2024 | ISPA | HSDP: Accelerating Large-scale Model Training via Efficient Sharded Data Parallelism. | Yanqi Hao, Zhiquan Lai, Wei Wang, Shengwei Li, Weijie Liu, Keshi Ge, Dongsheng Li |
| 2023 | CLUSTER | Prophet: Fine-grained Load Balancing for Parallel Training of Large-scale MoE Models. | Wei Wang, Zhiquan Lai, Shengwei Li, Weijie Liu, Keshi Ge, Yujie Liu, Ao Shen, Dongsheng Li |
| 2023 | EuroPar | Auto-Divide GNN: Accelerating GNN Training with Subgraph Division. | Hongyu Chen, Zhejiang Ran, Keshi Ge, Zhiquan Lai, Jingfei Jiang, Dongsheng Li |
| 2023 | HPCC | Communication Analysis for Multidimensional Parallel Training of Large-scale DNN Models. | Zhiquan Lai, Yanqi Hao, Shengwei Li, Dongsheng Li |
| 2023 | HPCC | Rethinking the Distributed DNN Training Cluster Design from the Cost-effectiveness View. | Zhiquan Lai, Yujie Liu, Wei Wang, Yanqi Hao, Dongsheng Li |
| 2023 | HPCC | Efficient Large Models Fine-tuning on Commodity Servers via Memory-balanced Pipeline Parallelism. | Yujie Liu, Zhiquan Lai, Weijie Liu, Wei Wang, Dongsheng Li |
| 2022 | CLUSTER | HPH: Hybrid Parallelism on Heterogeneous Clusters for Accelerating Large-scale DNNs Training. | Yabo Duan, Zhiquan Lai, Shengwei Li, Weijie Liu, Keshi Ge, Peng Liang, Dongsheng Li |
| 2022 | CLUSTER | AutoPipe: A Fast Pipeline Parallelism Approach with Balanced Partitioning and Micro-batch Slicing. | Weijie Liu, Zhiquan Lai, Shengwei Li, Yabo Duan, Keshi Ge, Dongsheng Li |
| 2022 | ICASSP | S2 Reducer: High-Performance Sparse Communication to Accelerate Distributed Deep Learning. | Keshi Ge, Yongquan Fu, Yiming Zhang, Zhiquan Lai, Xiaoge Deng, Dongsheng Li |
| 2022 | ICPP | EmbRace: Accelerating Sparse Communication for Distributed Training of Deep Neural Networks. | Shengwei Li, Zhiquan Lai, Dongsheng Li, Yiming Zhang, Xiangyu Ye, Yabo Duan |
| 2022 | ISPA | SCGraph: Accelerating Sample-based GNN Training by Staged Caching of Features on GPUs. | Yuqi He, Zhiquan Lai, Zhejiang Ran, Lizhi Zhang, Dongsheng Li |
| 2021 | CLUSTER | CASQ: Accelerate Distributed Deep Learning with Sketch-Based Gradient Quantization. | Keshi Ge, Yiming Zhang, Yongquan Fu, Zhiquan Lai, Xiaoge Deng, Dongsheng Li |
| 2021 | CLUSTER | 2PGraph: Accelerating GNN Training over Large Graphs on GPU Clusters. | Lizhi Zhang, Zhiquan Lai, Shengwei Li, Yu Tang, Feng Liu, Dongsheng Li |
| 2021 | ICPP | Hippie: A Data-Paralleled Pipeline Approach to Improve Memory-Efficiency and Scalability for Large DNN Training. | Xiangyu Ye, Zhiquan Lai, Shengwei Li, Lei Cai, Ding Sun, Linbo Qiao, Dongsheng Li |
| 2021 | IPCCC | Accelerate Graph Neural Network Training by Reusing Batch Data on GPUs. | Zhejiang Ran, Zhiquan Lai, Lizhi Zhang, Dongsheng Li |
| 2021 | ISPA | PCGraph: Accelerating GNN Inference on Large Graphs via Partition Caching. | Lizhi Zhang, Zhiquan Lai, Yu Tang, Dongsheng Li, Feng Liu, Xiaochun Luo |
| 2020 | INFOCOM | Poster Abstract: Model Average-based Distributed Training for Sparse Deep Neural Networks. | Yuetong Yang, Zhiquan Lai, Lei Cai, Dongsheng Li |
| 2019 | ICDCS | HPDL: Towards a General Framework for High-performance Distributed Deep Learning. | Dongsheng Li, Zhiquan Lai, Keshi Ge, Yiming Zhang, Zhaoning Zhang, Qinglin Wang, Huaimin Wang |
| 2014 | ICPADS | Rhymes: A shared virtual memory system for non-coherent tiled many-core architectures. | King Tin Lam, Jinghao Shi, Dominic Hung, Cho-Li Wang, Zhiquan Lai, Wangbin Zhu, Youliang Yan |