| 2025 | Efficient Fine-Grained Gpu Performance Modeling for Distributed Deep Learning of Llm. | Biyao Zhang, Mingkai Zheng, Debargha Ganguly, Xuecen Zhang, Vikash Singh, Vipin Chaudhary, Zhao Zhang |
| 2025 | GPU Kernel-Level Characterization and Optimization of Transformer Models: From Baseline to LoRA Fine-Tuning. | Sasi Snigdha Yadavalli, Badrinath Ramamurthy |
| 2025 | Enhanced MPI Intra-Node Communication Framework: A Hybrid Approach with Cooperative DMA Channel-Based Data Transfer. | Shulei Xu, Tu Tran, Dhabaleswar K. Panda |
| 2025 | Enabling Long FFT Convolutions on Memory-Constrained FPGAs via Chunking. | Peter Wang, Neelesh Gupta, Viktor K. Prasanna |
| 2025 | Maximizing Insights, Minimizing Data: I/O Time Prediction Using Transfer Learning. | Adrian Vo, Radita Liem, Julian M. Kunkel, Jay F. Lofstead, Philip H. Carns, Matthias Mller |
| 2025 | Image Patch-Question feature fusion model for HPC based Visual Question and Answering. | Isunuri Bala Venkateswarlu, Haridas Adinarayana |
| 2025 | The Dynamics of Bias Diffusion in Multi-Agent LLM Framework. | Murugappan Venkatachalam, Vijaya Dhaarshini V, Chitra P |
| 2025 | Communication-Centric UALink and NVLink Comparison for Large Scale AI Training. | Sai Krishna Vemuri, Ajay Joshi, Vijay Kumar Motagi, Rohit Sindhu, Venkata Ravi Shankar Jonnalagadda, Amandeep Singh, Praveen Kumar Rukmangada, Sachin Shaw, Vishal Tanna |
| 2025 | Evaluating CXL Memory Pooling for Scalable LLM Inference. | Sai Krishna Vemuri, Venkata Ravi Shankar Jonnalagadda, Ajay Joshi, Rohit Sindhu, Vijay Kumar Motagi, Amandeep Singh, Praveen Kumar Rukmangada, Sachin Shaw, Vishal Tanna |
| 2025 | GPU-Accelerated Neural ODEs for Stiff Dynamical Systems Using CVODES. | Ved Vartak, Subhajit Sanfui, Ramsatish Kaluri |
| 2025 | Integrating Research into High Performance Computing Education via Particle-in-Cell Simulations. | Libin Varghese, Ayushi Sharma, Bhaskar Chaudhury |
| 2025 | SnortML+: Bridging Rules and Learning for Zero-Day Defense. | Muthuraj Vairamuthu, Harsh Mistry |
| 2025 | Towards an Agentic AI Design across Edge and Cloud. | Shiva Sai Krishna Anand Tokal, Vaibhav Jha, Anand Eswaran, Praveen Jayachandran, Yogesh Simmhan |
| 2025 | Selection of Supervised Learning-Based Sparse Matrix Reordering Algorithms. | Tao Tang, Youfu Jiang, Yingbo Cui, Jianbin Fang, Peng Zhang, Lin Peng, Chun Huang |
| 2025 | AutoTuneGPU: An Energy-Aware Autotuning Framework for Machine Learning Workloads on GPUs. | Ananya Krishna Srivastava, Kumari Soumya, Gargi Alavani Prabhu |
| 2025 | Performance Analysis of Memory-Bound Deep Learning Recommendation Models. | Sakshi Srivastava, Abed Mohammad Kamaluddin, Praveen Tammana |
| 2025 | PEEP: A Tool for PErformance Effect Prediction. | G. Ramya Sri, Debiprasanna Sahoo, Ajaya Kumar Dash |
| 2025 | On the Adversarial Robustness of Efficient KANs. | Swetha Krishna Sriram, Aneesh Sreevallabh Chivukula, Anup Bera |
| 2025 | ZEUS: An Efficient GPU Optimization Method Integrating PSO, BFGS, and Automatic Differentiation. | Dominik Sos, Marc F. Paterno, Desh Ranjan, Mohammad Zubair |
| 2025 | NiceSched : Memory Locality Aware Dynamic Priority Scheduling in Tiered Memory. | Binwon Song, Minwoo Jo, Hayong Jeong, Heeseung Jo |
| 2025 | LLM4VV:: Evaluating Cutting-Edge LLMs for Generation and Evaluation of Directive-Based Parallel Programming Model Compiler Tests. | Zachariah Sollenberger, Rahul Patel, Saieda Ali Zada, Sunita Chandrasekaran |
| 2025 | Efficient AI-driven Subsurface Modeling: A Case Study on Scaling and Optimization. | Mitali Sinha, Yogesh Nakhate, S. Ahmad Zamanian |
| 2025 | Fast and Accurate MIS on Dynamic Graphs. | Agam Harpreet Singh, Neha Sharma, Aditya Trivedi, Dip Sankar Banerjee |
| 2025 | Hardware-Software Co-Design of Post-Quantum FALCON Digital Signature Scheme with RISC-V. | Rishabh Shrivastava, Utsav Banerjee |
| 2025 | Enabling Distributed Deep Learning frameworks on Trinetra-A Network. | Shruti Sharma, Rakesh Kumar Yadav, Yogeshwar Sonawane, Sanjay Wandhekar |