Skip to content

Aamir Shafi

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

38

Venues

13

Active years

2006–2026

Best venue rank

National

Where they publish

Papers

38 indexed papers, newest first.

YearVenueTitleAuthors
2026CCGRIDKernel-Initiated One-Sided Networking for GPU-Accelerated AI Workloads.Khaled Hamidouche, John Bachan, Pak Markthub, Peter-Jan Gootzen, Elena Agostini, Sylvain Jeaugey, Aamir Shafi, Georgios Theodorakis, Manjunath Gorentla Venkata
2024CCGRIDAccelerating Large Language Model Training with Hybrid GPU-based Compression.Lang Xu, Quentin Anthony, Qinghua Zhou, Nawras Alnaasan, Radha Gulhane, Aamir Shafi, Hari Subramoni, Dhabaleswar K. D. K. Panda
2024HiPCHyperSack: Distributed Hyperparameter Optimization for Deep Learning using Resource-Aware Scheduling on Heterogeneous GPU Systems.Nawras Alnaasan, Bharath Ramesh, Jinghan Yao, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2024HiPCUsing BlueField-3 SmartNICs to Offload Vector Operations in Krylov Subspace Methods.Kaushik Kandadi Suresh, Benjamin Michalowicz, Nick Contini, Bharath Ramesh, Mustafa Abduljabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2024HiPCScaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning.Lang Xu, Quentin Anthony, Jacob Hatef, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2024HOTICharacterizing Communication in Distributed Parameter-Efficient Fine-Tuning for Large Language Models.Nawras Alnaasan, Horng-Ruey Huang, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2024HOTIDemystifying the Communication Characteristics for Distributed Transformer Models.Quentin Anthony, Benjamin Michalowicz, Jacob Hatef, Lang Xu, Mustafa Abdul Jabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2024ICPPThe Case for Co-Designing Model Architectures with Hardware.Quentin Anthony, Jacob Hatef, Deepak Narayanan, Stella Biderman, Stas Bekman, Junqi Yin, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2023CCGRIDScaMP: Scalable Meta-Parallelism for Deep Learning Search.Quentin Anthony, Lang Xu, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2023CCGRIDScaMP: Scalable Meta-Parallelism for Deep Learning Search.Quentin Anthony, Lang Xu, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2023CCGRIDImplementing and Optimizing a GPU-aware MPI Library for Intel GPUs: Early Experiences.Chen-Chun Chen, Kawthar Shafie Khorassani, Goutham Kalikrishna Reddy Kuncham, Rahul Vaidya, Mustafa Abduljabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2023HiPCFlover: A Temporal Fusion Framework for Efficient Autoregressive Model Parallel Inference.Jinghan Yao, Nawras Alnaasan, Tian Chen, Aamir Shafi, Hari Subramoni, Dhabaleswar K. D. K. Panda
2023HOTIDesigning In-network Computing Aware Reduction Collectives in MPI.Bharath Ramesh, Goutham Kalikrishna Reddy Kuncham, Kaushik Kandadi Suresh, Rahul Vaidya, Nawras Alnaasan, Mustafa Abduljabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. D. K. Panda
2023ICFECPerformance Characterization of Using Quantization for DNN Inference on Edge Devices.Hyunho Ahn, Tian Chen, Nawras Alnaasan, Aamir Shafi, Mustafa Abduljabbar, Hari Subramoni, Dhabaleswar K. Panda
2022CLUSTERSpark Meets MPI: Towards High-Performance Communication Framework for Spark using MPI.Kinan Al-Attar, Aamir Shafi, Mustafa Abduljabbar, Hari Subramoni, Dhabaleswar K. Panda
2022HiPCAccDP: Accelerated Data-Parallel Distributed DNN Training for Modern GPU-Based HPC Clusters.Nawras Alnaasan, Arpan Jain, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2022HiPCDesigning Efficient Pipelined Communication Schemes using Compression in MPI Libraries.Bharath Ramesh, Qinghua Zhou, Aamir Shafi, Mustafa Abduljabbar, Hari Subramoni, Dhabaleswar K. Panda
2022HiPCEfficient Personalized and Non-Personalized Alltoall Communication for Modern Multi-HCA GPU-Based Clusters.Kaushik Kandadi Suresh, Akshay Paniraja Guptha, Benjamin Michalowicz, Bharath Ramesh, Mustafa Abduljabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2022HiPCAccelerating Broadcast Communication with GPU Compression for Deep Learning Workloads.Qinghua Zhou, Quentin Anthony, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2022HOTINetwork Assisted Non-Contiguous Transfers for GPU-Aware MPI Libraries.Kaushik Kandadi Suresh, Kawthar Shafie Khorassani, Chen-Chun Chen, Bharath Ramesh, Mustafa Abduljabbar, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2021CCGRIDEfficient MPI-based Communication for GPU-Accelerated Dask Applications.Aamir Shafi, Jahanzeb Maqbool Hashmi, Hari Subramoni, Dhabaleswar K. D. K. Panda
2021HiPCTowards Architecture-aware Hierarchical Communication Trees on Modern HPC Systems.Bharath Ramesh, Jahanzeb Maqbool Hashmi, Shulei Xu, Aamir Shafi, Seyedeh Mahdieh Ghazimirsaeed, Mohammadreza Bayatpour, Hari Subramoni, Dhabaleswar K. Panda
2021HiPCLayout-aware Hardware-assisted Designs for Derived Data Types in MPI.Kaushik Kandadi Suresh, Bharath Ramesh, Chen-Chun Chen, Seyedeh Mahdieh Ghazimirsaeed, Mohammadreza Bayatpour, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2021HOTIAccelerating CPU-based Distributed DNN Training on Modern HPC Clusters using BlueField-2 DPUs.Arpan Jain, Nawras Alnaasan, Aamir Shafi, Hari Subramoni, Dhabaleswar K. Panda
2020HiPCBlink: Towards Efficient RDMA-based Communication Coroutines for Parallel Python Applications.Aamir Shafi, Jahanzeb Maqbool Hashmi, Hari Subramoni, Dhabaleswar K. Panda
2020SCAccelerating GPU-based Machine Learning in Python using MPI Library: A Case Study with MVAPICH2-GDR.Seyedeh Mahdieh Ghazimirsaeed, Quentin Anthony, Aamir Shafi, Hari Subramoni, Dhabaleswar K. D. K. Panda
2018SBAC-PADPerformance Comparison of a Parallel Recommender Algorithm Across Three Hadoop-Based Frameworks.Christina Diedhiou, Bryan Carpenter, Aamir Shafi, Soumabha Sarkar, Ramazan Esmeli, Ryan Gadsdon
2015ICCSMPJ Express Meets YARN: Towards Java HPC on Hadoop Systems.Hamza Zafar, Farrukh Aftab Khan, Bryan Carpenter, Aamir Shafi, Asad Waqar Malik
2014ICCSHigh Performance Message-passing InfiniBand Communication Device for Java HPC.Omar Khan, Mohsan Jameel, Aamir Shafi
2014ICCSDesign and Implementation of Hybrid and Native Communication Devices for Java HPC.Bibrak Qamar, Ansar Javed, Mohsan Jameel, Aamir Shafi, Bryan Carpenter
2014SCTeaching parallel programming using Java.Aamir Shafi, Aleem Akhtar, Ansar Javed, Bryan Carpenter
2013CCGRIDAn MPI-IO Compliant Java Based Parallel I/O Library.Ammar Ahmad Awan, Muhammad Bilal Amin, Shujaat Hussain, Aamir Shafi, Sungyoung Lee
2012HealthComHigh performance Java sockets (HPJS) for scientific health clouds.Muhammad Bilal Amin, Aamir Shafi, Shujaat Hussain, Wajahat Ali Khan, Sungyoung Lee
2012PDCATTowards Efficient Support for Parallel I/O in Java HPC.Ammar Ahmad Awan, Muhammad Sohaib Ayub, Aamir Shafi, Sungyoung Lee
2012SPAAMemory-mapping support for reducer hyperobjects.I-Ting Angelina Lee, Aamir Shafi, Charles E. Leiserson
2006CLUSTERMPJ Express: Towards Thread Safe Java HPC.Mark Baker, Bryan Carpenter, Aamir Shafi
2006ICCSAn Approach to Buffer Management in Java HPC Messaging.Mark Baker, Bryan Carpenter, Aamir Shafi
2006ISPDCParallel and Distributed Computing with Java.Mark A. Baker, Matthew Grove, Aamir Shafi