Aamir Shafi
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
38
Venues
13
Active years
2006–2026
Best venue rank
National
Where they publish
Papers
38 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | CCGRID | Kernel-Initiated One-Sided Networking for GPU-Accelerated AI Workloads. | Khaled Hamidouche, John Bachan, Pak Markthub, Peter-Jan Gootzen, Elena Agostini, Sylvain Jeaugey, Aamir Shafi, Georgios Theodorakis, Manjunath Gorentla Venkata |
| 2024 | CCGRID | Accelerating Large Language Model Training with Hybrid GPU-based Compression. | Lang Xu, Quentin Anthony, Qinghua Zhou, Nawras Alnaasan, Radha Gulhane, Aamir Shafi, Hari Subramoni, Dhabaleswar K. D. K. Panda |
| 2024 | HiPC | HyperSack: Distributed Hyperparameter Optimization for Deep Learning using Resource-Aware Scheduling on Heterogeneous GPU Systems. | Nawras Alnaasan, Bharath Ramesh, Jinghan Yao, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2024 | HiPC | Using BlueField-3 SmartNICs to Offload Vector Operations in Krylov Subspace Methods. | Kaushik Kandadi Suresh, Benjamin Michalowicz, Nick Contini, Bharath Ramesh, Mustafa Abduljabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2024 | HiPC | Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning. | Lang Xu, Quentin Anthony, Jacob Hatef, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2024 | HOTI | Characterizing Communication in Distributed Parameter-Efficient Fine-Tuning for Large Language Models. | Nawras Alnaasan, Horng-Ruey Huang, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2024 | HOTI | Demystifying the Communication Characteristics for Distributed Transformer Models. | Quentin Anthony, Benjamin Michalowicz, Jacob Hatef, Lang Xu, Mustafa Abdul Jabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2024 | ICPP | The Case for Co-Designing Model Architectures with Hardware. | Quentin Anthony, Jacob Hatef, Deepak Narayanan, Stella Biderman, Stas Bekman, Junqi Yin, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2023 | CCGRID | ScaMP: Scalable Meta-Parallelism for Deep Learning Search. | Quentin Anthony, Lang Xu, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2023 | CCGRID | ScaMP: Scalable Meta-Parallelism for Deep Learning Search. | Quentin Anthony, Lang Xu, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2023 | CCGRID | Implementing and Optimizing a GPU-aware MPI Library for Intel GPUs: Early Experiences. | Chen-Chun Chen, Kawthar Shafie Khorassani, Goutham Kalikrishna Reddy Kuncham, Rahul Vaidya, Mustafa Abduljabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2023 | HiPC | Flover: A Temporal Fusion Framework for Efficient Autoregressive Model Parallel Inference. | Jinghan Yao, Nawras Alnaasan, Tian Chen, Aamir Shafi, Hari Subramoni, Dhabaleswar K. D. K. Panda |
| 2023 | HOTI | Designing In-network Computing Aware Reduction Collectives in MPI. | Bharath Ramesh, Goutham Kalikrishna Reddy Kuncham, Kaushik Kandadi Suresh, Rahul Vaidya, Nawras Alnaasan, Mustafa Abduljabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. D. K. Panda |
| 2023 | ICFEC | Performance Characterization of Using Quantization for DNN Inference on Edge Devices. | Hyunho Ahn, Tian Chen, Nawras Alnaasan, Aamir Shafi, Mustafa Abduljabbar, Hari Subramoni, Dhabaleswar K. Panda |
| 2022 | CLUSTER | Spark Meets MPI: Towards High-Performance Communication Framework for Spark using MPI. | Kinan Al-Attar, Aamir Shafi, Mustafa Abduljabbar, Hari Subramoni, Dhabaleswar K. Panda |
| 2022 | HiPC | AccDP: Accelerated Data-Parallel Distributed DNN Training for Modern GPU-Based HPC Clusters. | Nawras Alnaasan, Arpan Jain, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2022 | HiPC | Designing Efficient Pipelined Communication Schemes using Compression in MPI Libraries. | Bharath Ramesh, Qinghua Zhou, Aamir Shafi, Mustafa Abduljabbar, Hari Subramoni, Dhabaleswar K. Panda |
| 2022 | HiPC | Efficient Personalized and Non-Personalized Alltoall Communication for Modern Multi-HCA GPU-Based Clusters. | Kaushik Kandadi Suresh, Akshay Paniraja Guptha, Benjamin Michalowicz, Bharath Ramesh, Mustafa Abduljabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2022 | HiPC | Accelerating Broadcast Communication with GPU Compression for Deep Learning Workloads. | Qinghua Zhou, Quentin Anthony, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2022 | HOTI | Network Assisted Non-Contiguous Transfers for GPU-Aware MPI Libraries. | Kaushik Kandadi Suresh, Kawthar Shafie Khorassani, Chen-Chun Chen, Bharath Ramesh, Mustafa Abduljabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2021 | CCGRID | Efficient MPI-based Communication for GPU-Accelerated Dask Applications. | Aamir Shafi, Jahanzeb Maqbool Hashmi, Hari Subramoni, Dhabaleswar K. D. K. Panda |
| 2021 | HiPC | Towards Architecture-aware Hierarchical Communication Trees on Modern HPC Systems. | Bharath Ramesh, Jahanzeb Maqbool Hashmi, Shulei Xu, Aamir Shafi, Seyedeh Mahdieh Ghazimirsaeed, Mohammadreza Bayatpour, Hari Subramoni, Dhabaleswar K. Panda |
| 2021 | HiPC | Layout-aware Hardware-assisted Designs for Derived Data Types in MPI. | Kaushik Kandadi Suresh, Bharath Ramesh, Chen-Chun Chen, Seyedeh Mahdieh Ghazimirsaeed, Mohammadreza Bayatpour, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2021 | HOTI | Accelerating CPU-based Distributed DNN Training on Modern HPC Clusters using BlueField-2 DPUs. | Arpan Jain, Nawras Alnaasan, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda |
| 2020 | HiPC | Blink: Towards Efficient RDMA-based Communication Coroutines for Parallel Python Applications. | Aamir Shafi, Jahanzeb Maqbool Hashmi, Hari Subramoni, Dhabaleswar K. Panda |
| 2020 | SC | Accelerating GPU-based Machine Learning in Python using MPI Library: A Case Study with MVAPICH2-GDR. | Seyedeh Mahdieh Ghazimirsaeed, Quentin Anthony, Aamir Shafi, Hari Subramoni, Dhabaleswar K. D. K. Panda |
| 2018 | SBAC-PAD | Performance Comparison of a Parallel Recommender Algorithm Across Three Hadoop-Based Frameworks. | Christina Diedhiou, Bryan Carpenter, Aamir Shafi, Soumabha Sarkar, Ramazan Esmeli, Ryan Gadsdon |
| 2015 | ICCS | MPJ Express Meets YARN: Towards Java HPC on Hadoop Systems. | Hamza Zafar, Farrukh Aftab Khan, Bryan Carpenter, Aamir Shafi, Asad Waqar Malik |
| 2014 | ICCS | High Performance Message-passing InfiniBand Communication Device for Java HPC. | Omar Khan, Mohsan Jameel, Aamir Shafi |
| 2014 | ICCS | Design and Implementation of Hybrid and Native Communication Devices for Java HPC. | Bibrak Qamar, Ansar Javed, Mohsan Jameel, Aamir Shafi, Bryan Carpenter |
| 2014 | SC | Teaching parallel programming using Java. | Aamir Shafi, Aleem Akhtar, Ansar Javed, Bryan Carpenter |
| 2013 | CCGRID | An MPI-IO Compliant Java Based Parallel I/O Library. | Ammar Ahmad Awan, Muhammad Bilal Amin, Shujaat Hussain, Aamir Shafi, Sungyoung Lee |
| 2012 | HealthCom | High performance Java sockets (HPJS) for scientific health clouds. | Muhammad Bilal Amin, Aamir Shafi, Shujaat Hussain, Wajahat Ali Khan, Sungyoung Lee |
| 2012 | PDCAT | Towards Efficient Support for Parallel I/O in Java HPC. | Ammar Ahmad Awan, Muhammad Sohaib Ayub, Aamir Shafi, Sungyoung Lee |
| 2012 | SPAA | Memory-mapping support for reducer hyperobjects. | I-Ting Angelina Lee, Aamir Shafi, Charles E. Leiserson |
| 2006 | CLUSTER | MPJ Express: Towards Thread Safe Java HPC. | Mark Baker, Bryan Carpenter, Aamir Shafi |
| 2006 | ICCS | An Approach to Buffer Management in Java HPC Messaging. | Mark Baker, Bryan Carpenter, Aamir Shafi |
| 2006 | ISPDC | Parallel and Distributed Computing with Java. | Mark A. Baker, Matthew Grove, Aamir Shafi |