Ammar Ahmad Awan
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
22
Venues
10
Active years
2012–2023
Best venue rank
A*
Where they publish
Papers
22 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2023 | ICS | A Hybrid Tensor-Expert-Data Parallelism Approach to Optimize Mixture-of-Experts Training. | Siddharth Singh, Olatunji Ruwase, Ammar Ahmad Awan, Samyam Rajbhandari, Yuxiong He, Abhinav Bhatele |
| 2022 | HiPC | 1-bit LAMB: Communication Efficient Large-Scale Large-Batch Training with LAMB's Convergence Speed. | Conglong Li, Ammar Ahmad Awan, Hanlin Tang, Samyam Rajbhandari, Yuxiong He |
| 2022 | ICML | DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale. | Samyam Rajbhandari, Conglong Li, Zhewei Yao, Minjia Zhang, Reza Yazdani Aminabadi, Ammar Ahmad Awan, Jeff Rasley, Yuxiong He |
| 2022 | SC | DeepSpeed- Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale. | Reza Yazdani Aminabadi, Samyam Rajbhandari, Ammar Ahmad Awan, Cheng Li, Du Li, Elton Zheng, Olatunji Ruwase, Shaden Smith, Minjia Zhang, Jeff Rasley, Yuxiong He |
| 2021 | ICML | 1-bit Adam: Communication Efficient Large-Scale Training with Adam's Convergence Speed. | Hanlin Tang, Shaoduo Gan, Ammar Ahmad Awan, Samyam Rajbhandari, Conglong Li, Xiangru Lian, Ji Liu, Ce Zhang, Yuxiong He |
| 2020 | ICS | NV-group: link-efficient reduction for distributed deep learning on modern dense GPU systems. | Ching-Hsiang Chu, Pouya Kousha, Ammar Ahmad Awan, Kawthar Shafie Khorassani, Hari Subramoni, Dhabaleswar K. D. K. Panda |
| 2020 | SC | GEMS: GPU-enabled memory-aware model-parallelism system for distributed DNN training. | Arpan Jain, Ammar Ahmad Awan, Asmaa M. Aljuhani, Jahanzeb Maqbool Hashmi, Quentin G. Anthony, Hari Subramoni, Dhabaleswar K. Panda, Raghu Machiraju, Anil Parwani |
| 2019 | CCGRID | Scalable Distributed DNN Training using TensorFlow and CUDA-Aware MPI: Characterization, Designs, and Performance Evaluation. | Ammar Ahmad Awan, Jeroen Bdorf, Ching-Hsiang Chu, Hari Subramoni, Dhabaleswar K. Panda |
| 2019 | CLUSTER | Performance Characterization of DNN Training using TensorFlow and PyTorch on Modern Clusters. | Arpan Jain, Ammar Ahmad Awan, Quentin Anthony, Hari Subramoni, Dhabaleswar K. Panda |
| 2019 | HOTI | Communication Profiling and Characterization of Deep Learning Workloads on Clusters with High-Performance Interconnects. | Ammar Ahmad Awan, Arpan Jain, Ching-Hsiang Chu, Hari Subramoni, Dhabaleswar K. Panda |
| 2019 | PPoPP | High performance distributed deep learning: a beginner's guide. | Dhabaleswar K. Panda, Ammar Ahmad Awan, Hari Subramoni |
| 2019 | SC | Scaling TensorFlow, PyTorch, and MXNet using MVAPICH2 for High-Performance Deep Learning on Frontera. | Arpan Jain, Ammar Ahmad Awan, Hari Subramoni, Dhabaleswar K. Panda |
| 2019 | SC | OMB-UM: Design, Implementation, and Evaluation of CUDA Unified Memory Aware MPI Benchmarks. | Karthik Vadambacheri Manian, Ching-Hsiang Chu, Ammar Ahmad Awan, Kawthar Shafie Khorassani, Hari Subramoni |
| 2018 | HiPC | OC-DNN: Exploiting Advanced Unified Memory Capabilities in CUDA 9 and Volta GPUs for Out-of-Core DNN Training. | Ammar Ahmad Awan, Ching-Hsiang Chu, Hari Subramoni, Xiaoyi Lu, Dhabaleswar K. Panda |
| 2017 | ICPP | Efficient and Scalable Multi-Source Streaming Broadcast on GPU Clusters for Deep Learning. | Ching-Hsiang Chu, Xiaoyi Lu, Ammar Ahmad Awan, Hari Subramoni, Jahanzeb Maqbool Hashmi, Bracy Elton, Dhabaleswar K. Panda |
| 2017 | PPoPP | S-Caffe: Co-designing MPI Runtimes and Caffe for Scalable Deep Learning on Modern GPU Clusters. | Ammar Ahmad Awan, Khaled Hamidouche, Jahanzeb Maqbool Hashmi, Dhabaleswar K. Panda |
| 2017 | SC | An In-depth Performance Characterization of CPU- and GPU-based DNN Training on Modern Architectures. | Ammar Ahmad Awan, Hari Subramoni, Dhabaleswar K. Panda |
| 2016 | CCGRID | CUDA Kernel Based Collective Reduction Operations on Large-scale GPU Clusters. | Ching-Hsiang Chu, Khaled Hamidouche, Akshay Venkatesh, Ammar Ahmad Awan, Dhabaleswar K. Panda |
| 2016 | HiPC | CUDA M3: Designing Efficient CUDA Managed Memory-Aware MPI by Exploiting GDR and IPC. | Khaled Hamidouche, Ammar Ahmad Awan, Akshay Venkatesh, Dhabaleswar K. Panda |
| 2015 | CLUSTER | Exploiting GPUDirect RDMA in Designing High Performance OpenSHMEM for NVIDIA GPU Clusters. | Khaled Hamidouche, Akshay Venkatesh, Ammar Ahmad Awan, Hari Subramoni, Ching-Hsiang Chu, Dhabaleswar K. Panda |
| 2013 | CCGRID | An MPI-IO Compliant Java Based Parallel I/O Library. | Ammar Ahmad Awan, Muhammad Bilal Amin, Shujaat Hussain, Aamir Shafi, Sungyoung Lee |
| 2012 | PDCAT | Towards Efficient Support for Parallel I/O in Java HPC. | Ammar Ahmad Awan, Muhammad Sohaib Ayub, Aamir Shafi, Sungyoung Lee |