| 2026 | AAAI | PipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling. | Sijie Wang, Qiang Wang, Shaohuai Shi |
| 2026 | AAAI | SALR: Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models. | Longteng Zhang, Sen Wu, Shuai Hou, Zhengyu Qing, Zhuo Zheng, Danning Ke, Qihong Lin, Qiang Wang, Shaohuai Shi, Xiaowen Chu |
| 2026 | INFOCOM | HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap. | Wenxiang Lin, Xinglin Pan, Lin Zhang, Shaohuai Shi, Xuan Wang, Xiaowen Chu |
| 2026 | INFOCOM | Compass: Dissecting Communication and Computation Operators for Efficient LLM Training. | Guangyu Xiang, Lin Zhang, Haoxuan Yu, Xinglin Pan, Shaohuai Shi, Xiaowen Chu |
| 2026 | INFOCOM | Accelerating Multi-modal LLM Training with Adaptive Model Placement and Parallelization. | Yiming Yin, Shaohuai Shi, Qiang Wang, Xiaowen Chu |
| 2026 | SIGCOMM | ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training. | Wenxiang Lin, Xinglin Pan, Ruibo Fan, Shaohuai Shi, Xiaowen Chu |
| 2025 | ASPLOS | FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models. | Xinglin Pan, Wenxiang Lin, Lin Zhang, Shaohuai Shi, Zhenheng Tang, Rui Wang, Bo Li, Xiaowen Chu |
| 2025 | EuroPar | ScheInfer: Efficient Inference of Large Language Models with Task Scheduling on Moderate GPUs. | Wenxiang Lin, Xinglin Pan, Shaohuai Shi, Xuan Wang, Xiaowen Chu |
| 2025 | EuroPar | SQ-DeAR: Sparsified and Quantized Gradient Compression for Distributed Training. | Xinrui Yang, Shaohuai Shi |
| 2025 | ICA3PP | DeepFill: Accelerating MLLM Training by Filling Bubbles with Frozen Encoders. | Zhengyu Qing, Shaohuai Shi, Qiang Wang |
| 2025 | ICDCS | Mast: Efficient Training of Mixture-of-Experts Transformers with Task Pipelining and Ordering. | Wenxiang Lin, Xinglin Pan, Shaohuai Shi, Xuan Wang, Bo Li, Xiaowen Chu |
| 2025 | ICDCS | Mitigating Contention in Stream Multiprocessors for Pipelined Mixture of Experts: An SM-Aware Scheduling Approach. | Xinglin Pan, Rui Wang, Wenxiang Lin, Shaohuai Shi, Xiaowen Chu |
| 2025 | ICPADS | QPO: Accelerating Memory-Efficient DNN Training with Quantization and Pipelining. | Xiang Fan, Shaohuai Shi |
| 2025 | INFOCOM | SP-MoE: Expediting Mixture-of-Experts Training with Optimized Pipelining Planning. | Ne Wang, Wenxiang Lin, Lin Zhang, Shaohuai Shi, Ruiting Zhou, Bo Li |
| 2024 | DATE | Performance Analysis and Optimizations of Matrix Multiplications on ARMv8 Processors. | Hucheng Liu, Shaohuai Shi, Xuan Wang, Zoe L. Jiang, Qian Chen |
| 2024 | EuroSys | ScheMoE: An Extensible Mixture-of-Experts Distributed Training System with Tasks Scheduling. | Shaohuai Shi, Xinglin Pan, Qiang Wang, Chengjian Liu, Xiaozhe Ren, Zhongzhe Hu, Yu Yang, Bo Li, Xiaowen Chu |
| 2024 | ICLR | FedImpro: Measuring and Improving Client Update in Federated Learning. | Zhenheng Tang, Yonggang Zhang, Shaohuai Shi, Xinmei Tian, Tongliang Liu, Bo Han, Xiaowen Chu |
| 2024 | ICPP | Sparse Gradient Communication with AlltoAll for Accelerating Distributed Deep Learning. | Jing Peng, Zihan Li, Shaohuai Shi, Bo Li |
| 2024 | ICPP | Bandwidth-Aware and Overlap-Weighted Compression for Communication-Efficient Federated Learning. | Zichen Tang, Junlin Huang, Rudan Yan, Yuxin Wang, Zhenheng Tang, Shaohuai Shi, Amelie Chi Zhou, Xiaowen Chu |
| 2024 | INFOCOM | Parm: Efficient Training of Large Sparsely-Activated Models with Dedicated Schedules. | Xinglin Pan, Wenxiang Lin, Shaohuai Shi, Xiaowen Chu, Weinong Sun, Bo Li |
| 2024 | IWQoS | Scheduling Deep Learning Jobs in Multi-Tenant GPU Clusters via Wise Resource Sharing. | Yizhou Luo, Qiang Wang, Shaohuai Shi, Jiaxin Lai, Shuhan Qi, Jiajia Zhang, Xuan Wang |
| 2023 | ICDCS | DeAR: Accelerating Distributed Deep Learning with Fine-Grained All-Reduce Pipelining. | Lin Zhang, Shaohuai Shi, Xiaowen Chu, Wei Wang, Bo Li, Chengjian Liu |
| 2023 | ICDCS | Evaluation and Optimization of Gradient Compression for Distributed Deep Learning. | Lin Zhang, Longteng Zhang, Shaohuai Shi, Xiaowen Chu, Bo Li |
| 2023 | ICLR | Eva: Practical Second-order Optimization with Kronecker-vectorized Approximation. | Lin Zhang, Shaohuai Shi, Bo Li |
| 2023 | INFOCOM | PipeMoE: Accelerating Mixture-of-Experts through Adaptive Pipelining. | Shaohuai Shi, Xinglin Pan, Xiaowen Chu, Bo Li |
| 2023 | INFOCOM | Accelerating Distributed K-FAC with Efficient Collective Communication and Scheduling. | Lin Zhang, Shaohuai Shi, Bo Li |
| 2022 | ECCV | EASNet: Searching Elastic and Accurate Network Architecture for Stereo Matching. | Qiang Wang, Shaohuai Shi, Kaiyong Zhao, Xiaowen Chu |
| 2022 | ICML | Virtual Homogeneity Learning: Defending against Data Heterogeneity in Federated Learning. | Zhenheng Tang, Yonggang Zhang, Shaohuai Shi, Xin He, Bo Han, Xiaowen Chu |
| 2021 | AAAI | Automated Model Design and Benchmarking of Deep Learning Models for COVID-19 Detection with Chest CT Scans. | Xin He, Shihao Wang, Xiaowen Chu, Shaohuai Shi, Jiangping Tang, Xin Liu, Chenggang Yan, Jiyong Zhang, Guiguang Ding |
| 2021 | ICDCS | Accelerating Distributed K-FAC with Smart Parallelism of Computing and Communication Tasks. | Shaohuai Shi, Lin Zhang, Bo Li |
| 2021 | INFOCOM | Exploiting Simultaneous Communications to Accelerate Data Parallel Distributed Deep Learning. | Shaohuai Shi, Xiaowen Chu, Bo Li |
| 2020 | CCGRID | Benchmarking the Performance and Energy Efficiency of AI Accelerators for AI Training. | Yuxin Wang, Qiang Wang, Shaohuai Shi, Xin He, Zhenheng Tang, Kaiyong Zhao, Xiaowen Chu |
| 2020 | ECAI | Layer-Wise Adaptive Gradient Sparsification for Distributed Deep Learning with Convergence Guarantees. | Shaohuai Shi, Zhenheng Tang, Qiang Wang, Kaiyong Zhao, Xiaowen Chu |
| 2020 | ICDCS | Communication-Efficient Decentralized Learning with Sparsification and Adaptive Peer Selection. | Zhenheng Tang, Shaohuai Shi, Xiaowen Chu |
| 2020 | ICPADS | Efficient Sparse-Dense Matrix-Matrix Multiplication on GPUs Using the Customized Sparse Storage Format. | Shaohuai Shi, Qiang Wang, Xiaowen Chu |
| 2020 | INFOCOM | Communication-Efficient Distributed Deep Learning with Merged Gradient Sparsification on GPUs. | Shaohuai Shi, Qiang Wang, Xiaowen Chu, Bo Li, Yang Qin, Ruihao Liu, Xinxiao Zhao |
| 2020 | ICRA | FADNet: A Fast and Accurate Network for Disparity Estimation. | Qiang Wang, Shaohuai Shi, Shizhen Zheng, Kaiyong Zhao, Xiaowen Chu |
| 2019 | ICDCS | A Distributed Synchronous SGD Algorithm with Global Top-k Sparsification for Low Bandwidth Networks. | Shaohuai Shi, Qiang Wang, Kaiyong Zhao, Zhenheng Tang, Yuxin Wang, Xiang Huang, Xiaowen Chu |
| 2019 | IJCAI | A Convergence Analysis of Distributed SGD with Communication-Efficient Gradient Sparsification. | Shaohuai Shi, Kaiyong Zhao, Qiang Wang, Zhenheng Tang, Xiaowen Chu |
| 2019 | INFOCOM | MG-WFBP: Efficient Data Communication for Distributed Synchronous SGD Algorithms. | Shaohuai Shi, Xiaowen Chu, Bo Li |
| 2018 | DASC | Performance Modeling and Evaluation of Distributed Deep Learning Frameworks on GPUs. | Shaohuai Shi, Qiang Wang, Xiaowen Chu |
| 2018 | ICPADS | A DAG Model of Synchronous Stochastic Gradient Descent in Distributed Deep Learning. | Shaohuai Shi, Qiang Wang, Xiaowen Chu, Bo Li |
| 2017 | ICPADS | Supervised Learning Based Algorithm Selection for Deep Neural Networks. | Shaohuai Shi, Pengfei Xu, Xiaowen Chu |