| 2023 | Fast tree-based algorithms for DBSCAN for low-dimensional data on GPUs. | Andrey Prokopenko, Damien Lebrun-Grandi, Daniel Arndt |
| 2023 | Investigating Dependency Graph Discovery Impact on Task-based MPI+OpenMP Applications Performances. | Romain Pereira, Adrien Roussel, Patrick Carribault, Thierry Gautier |
| 2023 | ADARNet: Deep Learning Predicts Adaptive Mesh Refinement. | Octavi Obiols-Sales, Abhinav Vishnu, Nicholas Malaya, Aparna Chandramowlishwaran |
| 2023 | General-purpose Asynchronous Periodic Checkpointing in Hybrid Memory. | Masaki Nakata, Shigeyuki Sato, Tomoharu Ugawa |
| 2023 | Improving the Scaling of an Asynchronous Many-Task Runtime with a Lightweight Communication Engine. | Omri Mor, George Bosilca, Marc Snir |
| 2023 | GFFT: a Task Graph Based Fast Fourier Transform Optimization Framework. | Qinglin Lu, Xinyu Wang, Wenjing Ma, Yuwen Zhao, Daokun Chen, Fangfang Liu |
| 2023 | SPLIT: QoS-Aware DNN Inference on Shared GPU via Evenly-Sized Model Splitting. | Diaohan Luo, Tian Yu, Yuewen Wu, Heng Wu, Tao Wang, Wenbo Zhang |
| 2023 | PMLDS: An LSM-Tree Direct Managed Storage for Key-Value Stores on Byte-Addressable Devices. | Ziyi Lu, Qiang Cao, Shucheng Wang, Jie Yao, Xiangrui Yang |
| 2023 | Exploiting Subgraph Similarities for Efficient Auto-tuning of Tensor Programs. | Mingzhen Li, Hailong Yang, Shanjun Zhang, Fengwei Yu, Ruihao Gong, Yi Liu, Zhongzhi Luan, Depei Qian |
| 2023 | Group-based Hierarchical Federated Learning: Convergence, Group Formation, and Sampling. | Jiyao Liu, Xinliang Wei, Xuanzhang Liu, Hongchang Gao, Yu Wang |
| 2023 | Accelerating Large-Scale CFD Simulations with Lattice Boltzmann Method on a 40-Million-Core Sunway Supercomputer. | Zhao Liu, Xuesen Chu, Xiaojing Lv, Hanyue Liu, Haohuan Fu, Guangwen Yang |
| 2023 | EC-SpMM: Efficient Compilation of SpMM Kernel on GPUs. | Junqing Lin, Honghe Zhang, Xiaolong Shi, Jingwei Sun, Xianzhi Yu, Jun Yao, Guangzhong Sun |
| 2023 | Recoil: Parallel rANS Decoding with Decoder-Adaptive Scalability. | Fangzheng Lin, Kasidis Arunruangsirilert, Heming Sun, Jiro Katto |
| 2023 | Colossal-AI: A Unified Deep Learning System For Large-Scale Parallel Training. | Shenggui Li, Hongxin Liu, Zhengda Bian, Jiarui Fang, Haichen Huang, Yuliang Liu, Boxiang Wang, Yang You |
| 2023 | RadarSSD: A Computational Storage for Radar Signal Processing. | Jiali Li, Xianzhang Chen, Duo Liu, Ao Ren, Zhaoyang Zeng, Yujuan Tan |
| 2023 | NeiLatS: Neighbor-Aware Latency-Sensitive Application Scheduling in Heterogeneous Cloud-Edge Environment. | Huadong Li, Hui Liu, Changyuan Liu, Aoqi Chen, Zhaocheng Niu, Junzhao Du |
| 2023 | CoTrain: Efficient Scheduling for Large-Model Training upon GPU and CPU in Parallel. | Zhenxing Li, Qiang Cao, Yajie Chen, Wenrui Yan |
| 2023 | BEEP: Balanced Efficient subgraph Enumeration in Parallel. | Samiran Kawtikwar, Mohammad Almasri, Wen-Mei Hwu, Rakesh Nagi, Jinjun Xiong |
| 2023 | Impact of Cache Coherence on the Performance of Shared-Memory based MPI Primitives: A Case Study for Broadcast on Intel Xeon Scalable Processors. | George Katevenis, Manolis Ploumidis, Manolis Marazakis |
| 2023 | Communication Optimizations for State-vector Quantum Simulator on CPU+GPU Clusters. | Chenyang Jiao, Weihua Zhang, Li Shen |
| 2023 | SNICIT: Accelerating Sparse Neural Network Inference via Compression at Inference Time on GPU. | Shui Jiang, Tsung-Wei Huang, Bei Yu, Tsung-Yi Ho |
| 2023 | Output-Directed Dynamic Quantization for DNN Acceleration. | Beilei Jiang, Xianwei Cheng, Yuan Li, Jocelyn Zhang, Song Fu, Qing Yang, Mingxiong Liu, Alejandro Olvera |
| 2023 | Warped-MC: An Efficient Memory Controller Scheme for Massively Parallel Processors. | Jong-Hyun Jeong, Myung Kuk Yoon, Yunho Oh, Gunjae Koo |
| 2023 | Communication-Efficient Generalized Neuron Matching for Federated Learning. | Sixu Hu, Qinbin Li, Bingsheng He |
| 2023 | RLB: Reordering-Robust Load Balancing in Lossless Datacenter Networks. | Jinbin Hu, Yi He, Jin Wang, Wangqing Luo, Jiawei Huang |