| 2026 | HPDC | DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse. | Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai |
| 2026 | HPDC | SYCL++: A Unified Programming Framework for Heterogeneous Supercomputers at Scale. | Zitao Shen, Yuyang Jin, Kinman Lei, Zixuan Ma, Wenqiang Wang, Yinuo Wang, Wenhao Zhou, Zhenchuan Chen, Di Wei, Qi Zhang, Fei Wang, Ying Liu, Lin Gan, Jidong Zhai |
| 2025 | ICS | An Efficient 2D Fusion Method for High-Performance Two-Stage Eigensolvers on Modern Heterogeneous Architectures. | Yongxiao Zhou, Yi Zong, Yuyang Jin, Heng Li, Wei Xue |
| 2025 | NPC | HSampler : Optimizing Multi-GPU GNN Sampling with Collision-Avoid Selection. | Yuyang Jin, Jidong Zhai, Kezhao Huang, Weimin Zheng |
| 2025 | PPoPP | FlashTensor: Optimizing Tensor Programs by Leveraging Fine-grained Tensor Property. | Runxin Zhong, Yuyang Jin, Chen Zhang, Kinman Lei, Shuangyu Li, Jidong Zhai |
| 2025 | SC | TraceFlow: Efficient Trace Analysis for Large-Scale Parallel Applications via Interaction Pattern-Aware Trace Distribution. | Yuyang Jin, Xirui Shui, Mingshu Zhai, Zan Zong, Feng Zhang, Felix Wolf, Jidong Zhai |
| 2025 | SC | UltraAttn: Efficiently Parallelizing Attention through Hierarchical Context-Tiling. | Haoyu Yang, Zan Zong, Yuyang Jin, Kinman Lei, Jiaao He, Qigang Yang, Jidong Zhai |
| 2025 | USENIX | mTuner: Accelerating Parameter-Efficient Fine-Tuning on Multi-GPU Servers with Elastic Tensor. | Kezhao Huang, Siqi Zhu, Mingshu Zhai, Liyan Zheng, Kinman Lei, Jiaao He, Yuyang Jin, Jidong Zhai |
| 2024 | EuroSys | WiseGraph: Optimizing GNN with Joint Workload Partition of Graph and Operations. | Kezhao Huang, Jidong Zhai, Liyan Zheng, Haojie Wang, Yuyang Jin, Qihao Zhang, Runqing Zhang, Zhen Zheng, Youngmin Yi, Xipeng Shen |
| 2024 | ICPP | BoostN: Optimizing Imbalanced Neighborhood Communication on Homogeneous Many-Core System. | Haopeng Huang, Yuyang Jin, Wei Xue |
| 2024 | USENIX | PUZZLE: Efficiently Aligning Large Language Models through Light-Weight Context Switch. | Kinman Lei, Yuyang Jin, Mingshu Zhai, Kezhao Huang, Haoxing Ye, Jidong Zhai |
| 2022 | PPoPP | PerFlow: a domain specific framework for automatic performance analysis of parallel applications. | Yuyang Jin, Haojie Wang, Runxin Zhong, Chen Zhang, Jidong Zhai |
| 2022 | PPoPP | Vapro: performance variance detection and diagnosis for production-run parallel applications. | Liyan Zheng, Jidong Zhai, Xiongchao Tang, Haojie Wang, Teng Yu, Yuyang Jin, Shuaiwen Leon Song, Wenguang Chen |
| 2020 | PPoPP | Identifying scalability bottlenecks for large-scale parallel programs with graph analysis. | Yuyang Jin, Haojie Wang, Xiongchao Tang, Torsten Hoefler, Xu Liu, Jidong Zhai |
| 2020 | SC | ScalAna: automating scaling loss detection with graph analysis. | Yuyang Jin, Haojie Wang, Teng Yu, Xiongchao Tang, Torsten Hoefler, Xu Liu, Jidong Zhai |