Skip to content

Shaohuai Shi

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

43

Venues

20

Active years

2017–2026

Best venue rank

A*

Where they publish

Papers

43 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAIPipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling.Sijie Wang, Qiang Wang, Shaohuai Shi
2026AAAISALR: Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models.Longteng Zhang, Sen Wu, Shuai Hou, Zhengyu Qing, Zhuo Zheng, Danning Ke, Qihong Lin, Qiang Wang, Shaohuai Shi, Xiaowen Chu
2026INFOCOMHierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap.Wenxiang Lin, Xinglin Pan, Lin Zhang, Shaohuai Shi, Xuan Wang, Xiaowen Chu
2026INFOCOMCompass: Dissecting Communication and Computation Operators for Efficient LLM Training.Guangyu Xiang, Lin Zhang, Haoxuan Yu, Xinglin Pan, Shaohuai Shi, Xiaowen Chu
2026INFOCOMAccelerating Multi-modal LLM Training with Adaptive Model Placement and Parallelization.Yiming Yin, Shaohuai Shi, Qiang Wang, Xiaowen Chu
2026SIGCOMMZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training.Wenxiang Lin, Xinglin Pan, Ruibo Fan, Shaohuai Shi, Xiaowen Chu
2025ASPLOSFSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models.Xinglin Pan, Wenxiang Lin, Lin Zhang, Shaohuai Shi, Zhenheng Tang, Rui Wang, Bo Li, Xiaowen Chu
2025EuroParScheInfer: Efficient Inference of Large Language Models with Task Scheduling on Moderate GPUs.Wenxiang Lin, Xinglin Pan, Shaohuai Shi, Xuan Wang, Xiaowen Chu
2025EuroParSQ-DeAR: Sparsified and Quantized Gradient Compression for Distributed Training.Xinrui Yang, Shaohuai Shi
2025ICA3PPDeepFill: Accelerating MLLM Training by Filling Bubbles with Frozen Encoders.Zhengyu Qing, Shaohuai Shi, Qiang Wang
2025ICDCSMast: Efficient Training of Mixture-of-Experts Transformers with Task Pipelining and Ordering.Wenxiang Lin, Xinglin Pan, Shaohuai Shi, Xuan Wang, Bo Li, Xiaowen Chu
2025ICDCSMitigating Contention in Stream Multiprocessors for Pipelined Mixture of Experts: An SM-Aware Scheduling Approach.Xinglin Pan, Rui Wang, Wenxiang Lin, Shaohuai Shi, Xiaowen Chu
2025ICPADSQPO: Accelerating Memory-Efficient DNN Training with Quantization and Pipelining.Xiang Fan, Shaohuai Shi
2025INFOCOMSP-MoE: Expediting Mixture-of-Experts Training with Optimized Pipelining Planning.Ne Wang, Wenxiang Lin, Lin Zhang, Shaohuai Shi, Ruiting Zhou, Bo Li
2024DATEPerformance Analysis and Optimizations of Matrix Multiplications on ARMv8 Processors.Hucheng Liu, Shaohuai Shi, Xuan Wang, Zoe L. Jiang, Qian Chen
2024EuroSysScheMoE: An Extensible Mixture-of-Experts Distributed Training System with Tasks Scheduling.Shaohuai Shi, Xinglin Pan, Qiang Wang, Chengjian Liu, Xiaozhe Ren, Zhongzhe Hu, Yu Yang, Bo Li, Xiaowen Chu
2024ICLRFedImpro: Measuring and Improving Client Update in Federated Learning.Zhenheng Tang, Yonggang Zhang, Shaohuai Shi, Xinmei Tian, Tongliang Liu, Bo Han, Xiaowen Chu
2024ICPPSparse Gradient Communication with AlltoAll for Accelerating Distributed Deep Learning.Jing Peng, Zihan Li, Shaohuai Shi, Bo Li
2024ICPPBandwidth-Aware and Overlap-Weighted Compression for Communication-Efficient Federated Learning.Zichen Tang, Junlin Huang, Rudan Yan, Yuxin Wang, Zhenheng Tang, Shaohuai Shi, Amelie Chi Zhou, Xiaowen Chu
2024INFOCOMParm: Efficient Training of Large Sparsely-Activated Models with Dedicated Schedules.Xinglin Pan, Wenxiang Lin, Shaohuai Shi, Xiaowen Chu, Weinong Sun, Bo Li
2024IWQoSScheduling Deep Learning Jobs in Multi-Tenant GPU Clusters via Wise Resource Sharing.Yizhou Luo, Qiang Wang, Shaohuai Shi, Jiaxin Lai, Shuhan Qi, Jiajia Zhang, Xuan Wang
2023ICDCSDeAR: Accelerating Distributed Deep Learning with Fine-Grained All-Reduce Pipelining.Lin Zhang, Shaohuai Shi, Xiaowen Chu, Wei Wang, Bo Li, Chengjian Liu
2023ICDCSEvaluation and Optimization of Gradient Compression for Distributed Deep Learning.Lin Zhang, Longteng Zhang, Shaohuai Shi, Xiaowen Chu, Bo Li
2023ICLREva: Practical Second-order Optimization with Kronecker-vectorized Approximation.Lin Zhang, Shaohuai Shi, Bo Li
2023INFOCOMPipeMoE: Accelerating Mixture-of-Experts through Adaptive Pipelining.Shaohuai Shi, Xinglin Pan, Xiaowen Chu, Bo Li
2023INFOCOMAccelerating Distributed K-FAC with Efficient Collective Communication and Scheduling.Lin Zhang, Shaohuai Shi, Bo Li
2022ECCVEASNet: Searching Elastic and Accurate Network Architecture for Stereo Matching.Qiang Wang, Shaohuai Shi, Kaiyong Zhao, Xiaowen Chu
2022ICMLVirtual Homogeneity Learning: Defending against Data Heterogeneity in Federated Learning.Zhenheng Tang, Yonggang Zhang, Shaohuai Shi, Xin He, Bo Han, Xiaowen Chu
2021AAAIAutomated Model Design and Benchmarking of Deep Learning Models for COVID-19 Detection with Chest CT Scans.Xin He, Shihao Wang, Xiaowen Chu, Shaohuai Shi, Jiangping Tang, Xin Liu, Chenggang Yan, Jiyong Zhang, Guiguang Ding
2021ICDCSAccelerating Distributed K-FAC with Smart Parallelism of Computing and Communication Tasks.Shaohuai Shi, Lin Zhang, Bo Li
2021INFOCOMExploiting Simultaneous Communications to Accelerate Data Parallel Distributed Deep Learning.Shaohuai Shi, Xiaowen Chu, Bo Li
2020CCGRIDBenchmarking the Performance and Energy Efficiency of AI Accelerators for AI Training.Yuxin Wang, Qiang Wang, Shaohuai Shi, Xin He, Zhenheng Tang, Kaiyong Zhao, Xiaowen Chu
2020ECAILayer-Wise Adaptive Gradient Sparsification for Distributed Deep Learning with Convergence Guarantees.Shaohuai Shi, Zhenheng Tang, Qiang Wang, Kaiyong Zhao, Xiaowen Chu
2020ICDCSCommunication-Efficient Decentralized Learning with Sparsification and Adaptive Peer Selection.Zhenheng Tang, Shaohuai Shi, Xiaowen Chu
2020ICPADSEfficient Sparse-Dense Matrix-Matrix Multiplication on GPUs Using the Customized Sparse Storage Format.Shaohuai Shi, Qiang Wang, Xiaowen Chu
2020INFOCOMCommunication-Efficient Distributed Deep Learning with Merged Gradient Sparsification on GPUs.Shaohuai Shi, Qiang Wang, Xiaowen Chu, Bo Li, Yang Qin, Ruihao Liu, Xinxiao Zhao
2020ICRAFADNet: A Fast and Accurate Network for Disparity Estimation.Qiang Wang, Shaohuai Shi, Shizhen Zheng, Kaiyong Zhao, Xiaowen Chu
2019ICDCSA Distributed Synchronous SGD Algorithm with Global Top-k Sparsification for Low Bandwidth Networks.Shaohuai Shi, Qiang Wang, Kaiyong Zhao, Zhenheng Tang, Yuxin Wang, Xiang Huang, Xiaowen Chu
2019IJCAIA Convergence Analysis of Distributed SGD with Communication-Efficient Gradient Sparsification.Shaohuai Shi, Kaiyong Zhao, Qiang Wang, Zhenheng Tang, Xiaowen Chu
2019INFOCOMMG-WFBP: Efficient Data Communication for Distributed Synchronous SGD Algorithms.Shaohuai Shi, Xiaowen Chu, Bo Li
2018DASCPerformance Modeling and Evaluation of Distributed Deep Learning Frameworks on GPUs.Shaohuai Shi, Qiang Wang, Xiaowen Chu
2018ICPADSA DAG Model of Synchronous Stochastic Gradient Descent in Distributed Deep Learning.Shaohuai Shi, Qiang Wang, Xiaowen Chu, Bo Li
2017ICPADSSupervised Learning Based Algorithm Selection for Deep Neural Networks.Shaohuai Shi, Pengfei Xu, Xiaowen Chu