| 2025 | SINA: Accelerating Time Synchronization in Large-Scale Network Simulation Using In-Network Allreduce. | Dinghuang Hu, Dezun Dong, Xiangke Liao |
| 2025 | VES: Vectorized Sparse General Matrix-Matrix Multiplication on Multi-Core DSPs. | Chuhe Hong, Qinglin Wang, Xing Peng, Gencheng Liu, Qingyang Zhang, Xinhai Chen, Jie Liu |
| 2025 | Q-GEAR: Improving quantum simulation framework. | Ziqing Guo, Jan Balewski, Ziwen Pan |
| 2025 | Deadline-Aware Scheduling of Mixed-Criticality Tasks. | Maxime Gonthier, Kyle Chard, Ian T. Foster, Loris Marchal, Frdric Vivien |
| 2025 | Joint Task Scheduling and Resource Allocation in Cloud-Edge Collaborative Computing Systems. | Boyu Du, Jingya Zhou, Jin Wang, Jiangwei Wang, Zhijun Li |
| 2025 | HHOTuner: Efficient Performance Tuning with Harris Hawks Optimization. | Akash Dutta, Ali Jannesari |
| 2025 | CoreTuner: Predicting and Scheduling Framework for Optimizing the Joint Allocation of CPU and GPU in Training Cluster. | Hao Dong, Yuehao Xu, Xiaohui Wang, Xinhua Ji, Zhijun Ding |
| 2025 | Auto-Stencil: Performance-Driven Stencil Optimization with Hardware Feedback for LLMs. | Quan Deng, Lin Gan, Hongkun Yu, Wenlai Zhao, Guangwen Yang |
| 2025 | ParEval-Repo: A Benchmark Suite for Evaluating LLMs with Repository-level HPC Translation Tasks. | Joshua Hoke Davis, Daniel Nichols, Ishan Khillan, Abhinav Bhatele |
| 2025 | Fast and Scalable Mixed Precision Euclidean Distance Calculations Using GPU Tensor Cores. | Brian Curless, Michael Gowanlock |
| 2025 | One GPU, Many Ranks: Enabling Performance and Energy-Efficient In-Transit Visualization via Resource Sharing. | Matheus M. Costa, Philippe O. A. Navaux, Silvio Rizzi, Arthur Francisco Lorenzon |
| 2025 | Design and Optimization of GPU-Aware MPI Allreduce Using Direct Sendrecv Communication. | Chen-Chun Chen, Jinghan Yao, Hari Subramoni, Dhabaleswar K. Panda |
| 2025 | MixLoRA: An Efficient Multi-Tenant Framework for Concurrently Serving Diverse LoRA Models in Large Language Models. | Ronghuai Chen, Ce Yu, Hao Fu, Xiaoteng Hu, Bin Yang |
| 2025 | SYgraph: A Portable Heterogeneous Graph Analytics Framework for GPUs. | Antonio De Caro, Gennaro Cordasco, Biagio Cosenza |
| 2025 | Revisiting Multi-threaded Compaction in LSM-trees: Enabling Compaction Pipelining. | Hongsu Byun, Honghyeon Yoo, Sungyong Park |
| 2025 | Thievory: Graph Processing with Multi-GPU Memory Stealing. | Joo Brotas, Ricardo Nobre, Aleksandar Ilic |
| 2025 | Fast Exact Diameter Computation of Sparse Graphs. | Cameron Bradley, Anju Mongandampulath Akathoott, Martin Burtscher |
| 2025 | Architecture-Aware Models of AI Engines for High-Performance Matrix Matrix Multiplication. | Elliott D. Binder, Jeffrey Low, Tze Meng Low |
| 2025 | ViReC: The Virtual Register Context Architecture for Efficient Near-Memory Multithreading. | Matthew Barondeau, Sophia Jiang, Jonathan Beard, Andreas Gerstlauer |
| 2025 | BMapper: A Scalable and Efficient Framework for Brain Simulations Acceleration on Supercomputers. | Yubing Bao, Zhihui Lu, Qiang Duan, Xin Du, Zhongyu Chen, Yicong Zhao, Xiaoyi Li, Yandan Tan, Shuhan Yang, Ziyi Wang, Yang Chen, Yang Xu |
| 2025 | Pisces: Towards Adaptive and Fair Congestion Control via Multi-Agent Meta-Reinforcement Learning. | He Bai, Hui Li, Jianming Que, Minglong Zhang, Zhiqiang Hu, Ximing Xu, Bing Lin, Runhuai Huang, Junyang Qiu, Shaowen Deng |
| 2025 | TD-Pipe: Temporally-Disaggregated Pipeline Parallelism Architecture for High-Throughput LLM Inference. | Hongbin Zhang, Taosheng Wei, Zhenyi Zheng, Jiangsu Du, Zhiguang Chen, Yutong Lu |
| 2025 | CompreGel: Efficient Distributed Graph Propagation via Error-Bounded Lossy Message Compression. | Tianhao Wu, Da Yan, Qihao Cheng, Lyuheng Yuan, Sheng Di, Jiao Han, Zhongyi Huang, Ji Cheng |
| 2025 | Joint Prediction and Matching for Computing Resource Exchange Platforms. | Da Huo, Zhenzhe Zheng, Xiaoyao Huang, Hao Chen, Jianfeng Hu, Zhiyong Yan, Fan Wu, Jie Wu |
| 2025 | Origami: Efficient ML-Driven Metadata Load Balancing for Distributed File Systems. | Yiduo Wang, Wenda Tang, Linghang Meng, Liang Li, Jie Wu |