Skip to content

Ammar Ahmad Awan

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

22

Venues

10

Active years

2012–2023

Best venue rank

A*

Where they publish

Papers

22 indexed papers, newest first.

YearVenueTitleAuthors
2023ICSA Hybrid Tensor-Expert-Data Parallelism Approach to Optimize Mixture-of-Experts Training.Siddharth Singh, Olatunji Ruwase, Ammar Ahmad Awan, Samyam Rajbhandari, Yuxiong He, Abhinav Bhatele
2022HiPC1-bit LAMB: Communication Efficient Large-Scale Large-Batch Training with LAMB's Convergence Speed.Conglong Li, Ammar Ahmad Awan, Hanlin Tang, Samyam Rajbhandari, Yuxiong He
2022ICMLDeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale.Samyam Rajbhandari, Conglong Li, Zhewei Yao, Minjia Zhang, Reza Yazdani Aminabadi, Ammar Ahmad Awan, Jeff Rasley, Yuxiong He
2022SCDeepSpeed- Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale.Reza Yazdani Aminabadi, Samyam Rajbhandari, Ammar Ahmad Awan, Cheng Li, Du Li, Elton Zheng, Olatunji Ruwase, Shaden Smith, Minjia Zhang, Jeff Rasley, Yuxiong He
2021ICML1-bit Adam: Communication Efficient Large-Scale Training with Adam's Convergence Speed.Hanlin Tang, Shaoduo Gan, Ammar Ahmad Awan, Samyam Rajbhandari, Conglong Li, Xiangru Lian, Ji Liu, Ce Zhang, Yuxiong He
2020ICSNV-group: link-efficient reduction for distributed deep learning on modern dense GPU systems.Ching-Hsiang Chu, Pouya Kousha, Ammar Ahmad Awan, Kawthar Shafie Khorassani, Hari Subramoni, Dhabaleswar K. D. K. Panda
2020SCGEMS: GPU-enabled memory-aware model-parallelism system for distributed DNN training.Arpan Jain, Ammar Ahmad Awan, Asmaa M. Aljuhani, Jahanzeb Maqbool Hashmi, Quentin G. Anthony, Hari Subramoni, Dhabaleswar K. Panda, Raghu Machiraju, Anil Parwani
2019CCGRIDScalable Distributed DNN Training using TensorFlow and CUDA-Aware MPI: Characterization, Designs, and Performance Evaluation.Ammar Ahmad Awan, Jeroen Bdorf, Ching-Hsiang Chu, Hari Subramoni, Dhabaleswar K. Panda
2019CLUSTERPerformance Characterization of DNN Training using TensorFlow and PyTorch on Modern Clusters.Arpan Jain, Ammar Ahmad Awan, Quentin Anthony, Hari Subramoni, Dhabaleswar K. Panda
2019HOTICommunication Profiling and Characterization of Deep Learning Workloads on Clusters with High-Performance Interconnects.Ammar Ahmad Awan, Arpan Jain, Ching-Hsiang Chu, Hari Subramoni, Dhabaleswar K. Panda
2019PPoPPHigh performance distributed deep learning: a beginner's guide.Dhabaleswar K. Panda, Ammar Ahmad Awan, Hari Subramoni
2019SCScaling TensorFlow, PyTorch, and MXNet using MVAPICH2 for High-Performance Deep Learning on Frontera.Arpan Jain, Ammar Ahmad Awan, Hari Subramoni, Dhabaleswar K. Panda
2019SCOMB-UM: Design, Implementation, and Evaluation of CUDA Unified Memory Aware MPI Benchmarks.Karthik Vadambacheri Manian, Ching-Hsiang Chu, Ammar Ahmad Awan, Kawthar Shafie Khorassani, Hari Subramoni
2018HiPCOC-DNN: Exploiting Advanced Unified Memory Capabilities in CUDA 9 and Volta GPUs for Out-of-Core DNN Training.Ammar Ahmad Awan, Ching-Hsiang Chu, Hari Subramoni, Xiaoyi Lu, Dhabaleswar K. Panda
2017ICPPEfficient and Scalable Multi-Source Streaming Broadcast on GPU Clusters for Deep Learning.Ching-Hsiang Chu, Xiaoyi Lu, Ammar Ahmad Awan, Hari Subramoni, Jahanzeb Maqbool Hashmi, Bracy Elton, Dhabaleswar K. Panda
2017PPoPPS-Caffe: Co-designing MPI Runtimes and Caffe for Scalable Deep Learning on Modern GPU Clusters.Ammar Ahmad Awan, Khaled Hamidouche, Jahanzeb Maqbool Hashmi, Dhabaleswar K. Panda
2017SCAn In-depth Performance Characterization of CPU- and GPU-based DNN Training on Modern Architectures.Ammar Ahmad Awan, Hari Subramoni, Dhabaleswar K. Panda
2016CCGRIDCUDA Kernel Based Collective Reduction Operations on Large-scale GPU Clusters.Ching-Hsiang Chu, Khaled Hamidouche, Akshay Venkatesh, Ammar Ahmad Awan, Dhabaleswar K. Panda
2016HiPCCUDA M3: Designing Efficient CUDA Managed Memory-Aware MPI by Exploiting GDR and IPC.Khaled Hamidouche, Ammar Ahmad Awan, Akshay Venkatesh, Dhabaleswar K. Panda
2015CLUSTERExploiting GPUDirect RDMA in Designing High Performance OpenSHMEM for NVIDIA GPU Clusters.Khaled Hamidouche, Akshay Venkatesh, Ammar Ahmad Awan, Hari Subramoni, Ching-Hsiang Chu, Dhabaleswar K. Panda
2013CCGRIDAn MPI-IO Compliant Java Based Parallel I/O Library.Ammar Ahmad Awan, Muhammad Bilal Amin, Shujaat Hussain, Aamir Shafi, Sungyoung Lee
2012PDCATTowards Efficient Support for Parallel I/O in Java HPC.Ammar Ahmad Awan, Muhammad Sohaib Ayub, Aamir Shafi, Sungyoung Lee