| 2026 | PPoPP | JanusQuant: Accurate and Efficient 2-bit KV Cache Quantization for Long-Context Inference. | Chengyu Sun, Yaqi Xia, Hulin Wang, Donglin Yang, Xiaobo Zhou, Dazhao Cheng |
| 2025 | PPoPP | Harnessing Inter-GPU Shared Memory for Seamless MoE Communication-Computation Fusion. | Hulin Wang, Yaqi Xia, Donglin Yang, Xiaobo Zhou, Dazhao Cheng |
| 2025 | SC | MXBLAS: Accelerating 8-bit Deep Learning with a Unified Micro-Scaled GEMM Library. | Weihu Wang, Yaqi Xia, Donglin Yang, Xiaobo Zhou, Dazhao Cheng |
| 2025 | USENIX | Voltrix: Sparse Matrix-Matrix Multiplication on Tensor Cores with Asynchronous and Balanced Kernel Optimization. | Yaqi Xia, Weihu Wang, Donglin Yang, Xiaobo Zhou, Dazhao Cheng |
| 2024 | SC | Accelerating Distributed DLRM Training with Optimized TT Decomposition and Micro-Batching. | Weihu Wang, Yaqi Xia, Donglin Yang, Xiaobo Zhou, Dazhao Cheng |
| 2024 | SC | Scaling New Heights: Transformative Cross-GPU Sampling for Training Billion-Edge Graphs. | Yaqi Xia, Donglin Yang, Xiaobo Zhou, Dazhao Cheng |
| 2023 | HPDC | Redundancy-Free High-Performance Dynamic GNN Training with Hierarchical Pipeline Parallelism. | Yaqi Xia, Zheng Zhang, Hulin Wang, Donglin Yang, Xiaobo Zhou, Dazhao Cheng |