Skip to content

Ching-Hsiang Chu

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

21

Venues

12

Active years

2015–2026

Best venue rank

A*

Where they publish

Papers

21 indexed papers, newest first.

YearVenueTitleAuthors
2026SIGCOMMConnecting 100K+ GPUs: Building the Communication Stack for Large-Scale LLM Training.Hongyi Zeng, Min Si, Pavan Balaji, Yongzhou Chen, Ching-Hsiang Chu, Adithya Gangidi, Prashanth Kannan, Bingzhe Liu, Saif Hasan, Dong He, Deep Shah, Ashmitha Jeevaraj Shetty, Gregory R. Steinbrecher, Srikanth Sundaresan, Yulun Wang, Yexin Wu, Mingran Yang, Kenny Yu, Minlan Yu, Cen Zhao, Shengbao Zheng, Wesley Bland, Denis Boyda, Suman Gumudavelli, Subodh Iyengar, Daniel Johnson, Cristian Lumezanu, Kai Luo, Rui Miao, Zhe Qu, Venkatraghavan Ramesh, Jingliang Ren, Maxim Samoylov, Jan Seidel, Qiye Tan, Feng Tian, Xinfeng Xie, Jingyi Yang, Yimeng Zhao, Shuqiang Zhang, Tiane Art Zhu
2025ISCAScaling Llama 3 Training with Efficient Parallelism Strategies.Weiwei Chu, Xinfeng Xie, Jiecao Yu, Jie Wang, Amar Phanishayee, Chunqiang Tang, Yuchen Hao, Jianyu Huang, Mustafa Ozdal, Jun Wang, Vedanuj Goswami, Naman Goyal, Abhishek Kadian, Andrew Gu, Chris Cai, Feng Tian, Xiaodong Wang, Min Si, Pavan Balaji, Ching-Hsiang Chu, Jongsoo Park
2024SCAccelerating Communication in Deep Learning Recommendation Model Training with Dual-Level Adaptive Lossy Compression.Hao Feng, Boyuan Zhang, Fanjiang Ye, Min Si, Ching-Hsiang Chu, Jiannan Tian, Chunxing Yin, Summer Deng, Yuchen Hao, Pavan Balaji, Tong Geng, Dingwen Tao
2023NSDIBetter Together: Jointly Optimizing ML Collective Scheduling and Execution Planning using SYNDICATE.Kshiteej Mahajan, Ching-Hsiang Chu, Srinivas Sridharan, Aditya Akella
2022ISCASoftware-hardware co-design for fast and scalable training of deep learning recommendation models.Dheevatsa Mudigere, Yuchen Hao, Jianyu Huang, Zhihao Jia, Andrew Tulloch, Srinivas Sridharan, Xing Liu, Mustafa Ozdal, Jade Nie, Jongsoo Park, Liang Luo, Jie Amy Yang, Leon Gao, Dmytro Ivchenko, Aarti Basant, Yuxi Hu, Jiyan Yang, Ehsan K. Ardestani, Xiaodong Wang, Rakesh Komuravelli, Ching-Hsiang Chu, Serhat Yilmaz, Huayu Li, Jiyuan Qian, Zhuobo Feng, Yinbin Ma, Junjie Yang, Ellie Wen, Hong Li, Lin Yang, Chonglin Sun, Whitney Zhao, Dimitry Melts, Krishna Dhulipala, K. R. Kishore, Tyler Graf, Assaf Eisenman, Kiran Kumar Matam, Adi Gangidi, Guoqiang Jerry Chen, Manoj Krishnan, Avinash Nayak, Krishnakumar Nair, Bharath Muthiah, Mahmoud khorashadi, Pallab Bhattacharya, Petr Lapukhov, Maxim Naumov, Ajit Mathews, Lin Qiao, Mikhail Smelyanskiy, Bill Jia, Vijay Rao
2021CCGRIDAdaptive and Hierarchical Large Message All-to-all Communication Algorithms for Large-scale Dense GPU Systems.Kawthar Shafie Khorassani, Ching-Hsiang Chu, Quentin G. Anthony, Hari Subramoni, Dhabaleswar K. Panda
2020CLUSTERDynamic Kernel Fusion for Bulk Non-contiguous Data Transfer on GPU Clusters.Ching-Hsiang Chu, Kawthar Shafie Khorassani, Qinghua Zhou, Hari Subramoni, Dhabaleswar K. Panda
2020ICSNV-group: link-efficient reduction for distributed deep learning on modern dense GPU systems.Ching-Hsiang Chu, Pouya Kousha, Ammar Ahmad Awan, Kawthar Shafie Khorassani, Hari Subramoni, Dhabaleswar K. D. K. Panda
2019ASPLOSCharacterizing CUDA Unified Memory (UM)-Aware MPI Designs on Modern GPU Architectures.Karthik Vadambacheri Manian, A. A. Ammar, Amit Ruhela, Ching-Hsiang Chu, Hari Subramoni, Dhabaleswar K. Panda
2019CCGRIDScalable Distributed DNN Training using TensorFlow and CUDA-Aware MPI: Characterization, Designs, and Performance Evaluation.Ammar Ahmad Awan, Jeroen Bdorf, Ching-Hsiang Chu, Hari Subramoni, Dhabaleswar K. Panda
2019HiPCHigh-Performance Adaptive MPI Derived Datatype Communication for Modern Multi-GPU Systems.Ching-Hsiang Chu, Jahanzeb Maqbool Hashmi, Kawthar Shafie Khorassani, Hari Subramoni, Dhabaleswar K. Panda
2019HiPCDesigning a Profiling and Visualization Tool for Scalable and In-depth Analysis of High-Performance GPU Clusters.Pouya Kousha, Bharath Ramesh, Kaushik Kandadi Suresh, Ching-Hsiang Chu, Arpan Jain, Nick Sarkauskas, Hari Subramoni, Dhabaleswar K. Panda
2019HOTICommunication Profiling and Characterization of Deep Learning Workloads on Clusters with High-Performance Interconnects.Ammar Ahmad Awan, Arpan Jain, Ching-Hsiang Chu, Hari Subramoni, Dhabaleswar K. Panda
2019SCOMB-UM: Design, Implementation, and Evaluation of CUDA Unified Memory Aware MPI Benchmarks.Karthik Vadambacheri Manian, Ching-Hsiang Chu, Ammar Ahmad Awan, Kawthar Shafie Khorassani, Hari Subramoni
2018HiPCOC-DNN: Exploiting Advanced Unified Memory Capabilities in CUDA 9 and Volta GPUs for Out-of-Core DNN Training.Ammar Ahmad Awan, Ching-Hsiang Chu, Hari Subramoni, Xiaoyi Lu, Dhabaleswar K. Panda
2017ICPPEfficient and Scalable Multi-Source Streaming Broadcast on GPU Clusters for Deep Learning.Ching-Hsiang Chu, Xiaoyi Lu, Ammar Ahmad Awan, Hari Subramoni, Jahanzeb Maqbool Hashmi, Bracy Elton, Dhabaleswar K. Panda
2017ICPPMPI-GDS: High Performance MPI Designs with GPUDirect-aSync for CPU-GPU Control Flow Decoupling.Akshay Venkatesh, Khaled Hamidouche, Sreeram Potluri, Davide Rossetti, Ching-Hsiang Chu, Dhabaleswar K. Panda
2016CCGRIDCUDA Kernel Based Collective Reduction Operations on Large-scale GPU Clusters.Ching-Hsiang Chu, Khaled Hamidouche, Akshay Venkatesh, Ammar Ahmad Awan, Dhabaleswar K. Panda
2016SCEfficient Reliability Support for Hardware Multicast-Based Broadcast in GPU-enabled Streaming Applications.Ching-Hsiang Chu, Khaled Hamidouche, Hari Subramoni, Akshay Venkatesh, Bracy Elton, Dhabaleswar K. Panda
2016SBAC-PADDesigning High Performance Heterogeneous Broadcast for Streaming Applications on GPU Clusters.Ching-Hsiang Chu, Khaled Hamidouche, Hari Subramoni, Akshay Venkatesh, Bracy Elton, Dhabaleswar K. Panda
2015CLUSTERExploiting GPUDirect RDMA in Designing High Performance OpenSHMEM for NVIDIA GPU Clusters.Khaled Hamidouche, Akshay Venkatesh, Ammar Ahmad Awan, Hari Subramoni, Ching-Hsiang Chu, Dhabaleswar K. Panda