| 2024 | SPHINX: Search Space-Pruning Heterogeneous Task Scheduling for Deep Neural Networks. | Bowen Yuchi, Heng Shi, Guoqing Bao |
| 2024 | Enabling Performance Observability for Heterogeneous HPC Workflows with SOMA. | Dewi Yokelson, Mikhail Titov, Srinivasan Ramesh, Ozgur O. Kilic, Matteo Turilli, Shantenu Jha, Allen D. Malony |
| 2024 | Viper: A High-Performance I/O Framework for Transparently Updating, Storing, and Transferring Deep Neural Network Models. | Jie Ye, Jaime Cernuda, Neeraj Rajesh, Keith Bateman, Orcun Yildiz, Tom Peterka, Arnur Nigmetov, Dmitriy Morozov, Xian-He Sun, Anthony Kougkas, Bogdan Nicolae |
| 2024 | PREACT: Predictive Resource Allocation for Bursty Workloads in a Co-located Data Center. | Dingyu Yang, Ziyang Xiao, Dongxiang Zhang, Shuhao Zhang, Jian Cao, Gang Chen |
| 2024 | Holmes: Towards Distributed Training Across Clusters with Heterogeneous NIC Environment. | Fei Yang, Shuang Peng, Ning Sun, Fangyu Wang, Yuanyuan Wang, Fu Wu, Jiezhong Qiu, Aimin Pan |
| 2024 | FNCC: Fast Notification Congestion Control in Data Center Networks. | Jing Xu, Zhan Wang, Fan Yang, Ning Kang, Zhenlong Ma, Guojun Yuan, Guangming Tan, Ninghui Sun |
| 2024 | Distributed Minimax Fair Optimization over Hierarchical Networks. | Wen Xu, Juncheng Wang, Ben Liang, Gary Boudreau, Hamza Umit Sokun |
| 2024 | DiStore: A Fully Memory Disaggregation Friendly Key-Value Store with Improved Tail Latency and Space Efficiency. | Ziwei Xiong, Dejun Jiang, Jin Xiong |
| 2024 | ChronusFed: Reinforcement-Based Adaptive Partial Training for Heterogeneous Federated Learning. | Fuyuan Xia, Chenhao Ying, David S. L. Wei, Wei Chen, Weiting Zhang, Haiming Jin, Yuan Luo |
| 2024 | CIM-KF: Efficient Computing-in-memory Circuits for Full-Process Execution of Kalman Filter Algorithm. | Pingdan Xiao, Qinghui Hong, Sichun Du, Jiliang Zhang |
| 2024 | PRoof: A Comprehensive Hierarchical Profiling Framework for Deep Neural Networks with Roofline Analysis. | Siyu Wu, Hailong Yang, Xin You, Ruihao Gong, Yi Liu, Zhongzhi Luan, Depei Qian |
| 2024 | AUTOHET: An Automated Heterogeneous ReRAM-Based Accelerator for DNN Inference. | Tong Wu, Shuibing He, Jianxin Zhu, Weijian Chen, Siling Yang, Ping Chen, Yanlong Yin, Xuechen Zhang, Xian-He Sun, Gang Chen |
| 2024 | Massively Parallel Inverse Block-sorting Transforms for bzip2 Decompression on GPUs. | Andr Weienberger, Bertil Schmidt |
| 2024 | SIndex: An SSD-based Large-scale Indexing with Deterministic Latency for Cloud Block Storage. | Shucheng Wang, Kaiye Zhou, Zhandong Guo, Qiang Cao, Jun Xu, Jie Yao |
| 2024 | Parallel Optimization for Accelerating the Generation of Correctly Rounded Elementary Functions. | Xianglin Wang, Xin Yi, Hengbiao Yu, Chun Huang, Lin Peng |
| 2024 | Arlo: Serving Transformer-based Language Models with Dynamic Input Lengths. | Xin Tan, Jiamin Li, Yitao Yang, Jingzong Li, Hong Xu |
| 2024 | Bandwidth-Aware and Overlap-Weighted Compression for Communication-Efficient Federated Learning. | Zichen Tang, Junlin Huang, Rudan Yan, Yuxin Wang, Zhenheng Tang, Shaohuai Shi, Amelie Chi Zhou, Xiaowen Chu |
| 2024 | Yggdrasil: Reducing Network I/O Tax with (CXL-Based) Distributed Shared Memory. | Wenda Tang, Ying Han, Tianxiang Ai, Guanghui Li, Bin Yu, Xin Yang |
| 2024 | GPU Algorithms for Fastest Path Problem in Temporal Graphs. | Mithinti Srikanth, Prashant Singh, G. Ramakrishna |
| 2024 | TeMCO: Tensor Memory Compiler Optimization across Tensor Decompositions in Deep Learning Inference. | Seungbin Song, Ju Min Lee, Haeeun Jeong, Hyunho Kwon, Shinnung Jeong, Jaeho Lee, Hanjun Kim |
| 2024 | Accelerated Constrained Sparse Tensor Factorization on Massively Parallel Architectures. | Yongseok Soh, Ramakrishnan Kannan, Piyush Sao, Jee Choi |
| 2024 | RMASanitizer: Generalized Runtime Detection of Data Races in Remote Memory Access Applications. | Simon Schwitanski, Yussur Mustafa Oraji, Cornelius Ptzold, Joachim Jenke, Felix Tomski, Matthias S. Mller |
| 2024 | Harnessing Integrated CPU-GPU System Memory for HPC: a first look into Grace Hopper. | Gabin Schieffer, Jacob Wahlgren, Jie Ren, Jennifer Faj, Ivy Peng |
| 2024 | PANDORA: A Parallel Dendrogram Construction Algorithm for Single Linkage Clustering on GPU. | Piyush Sao, Andrey Prokopenko, Damien Lebrun-Grandi |
| 2024 | Fast Leiden Algorithm for Community Detection in Shared Memory Setting. | Subhajit Sahu, Kishore Kothapalli, Dip Sankar Banerjee |