| 2024 | Memory Bounds for Concurrent Bounded Queues. | Vitaly Aksenov, Nikita Koval, Petr Kuznetsov, Anton Paramonov |
| 2024 | Fast American Option Pricing using Nonlinear Stencils. | Zafar Ahmad, Reilly Browne, Rezaul Chowdhury, Rathish Das, Yushen Huang, Yimin Zhu |
| 2023 | TailWAG: Tail Latency Workload Analysis and Generation. | Heng Zhuo, Mikko H. Lipasti |
| 2023 | Swift: Expedited Failure Recovery for Large-Scale DNN Training. | Yuchen Zhong, Guangming Sheng, Juncheng Liu, Jinhui Yuan, Chuan Wu |
| 2023 | Boosting Performance and QoS for Concurrent GPU B+trees by Combining-Based Synchronization. | Weihua Zhang, Chuanlei Zhao, Lu Peng, Yuzhe Lin, Fengzhe Zhang, Yunping Lu |
| 2023 | Fast Symmetric Eigenvalue Decomposition via WY Representation on Tensor Core. | Shaoshuai Zhang, Ruchi Shah, Hiroyuki Ootomo, Rio Yokota, Panruo Wu |
| 2023 | WISE: Predicting the Performance of Sparse Matrix Vector Multiplication with Machine Learning. | Serif Yesil, Azin Heidarshenas, Adam Morrison, Josep Torrellas |
| 2023 | Exploring OpenMP GPU Offloading for Implementing Convolutional Neural Networks. | Kewei Yan, Yaying Shi, Yonghong Yan |
| 2023 | High-Throughput GPU Random Walk with Fine-Tuned Concurrent Query Processing. | Cheng Xu, Chao Li, Pengyu Wang, Xiaofeng Hou, Jing Wang, Shixuan Sun, Minyi Guo, Hanqing Wu, Dongbai Chen, Xiangwen Liu |
| 2023 | Merchandiser: Data Placement on Heterogeneous Memory for Task-Parallel HPC Applications with Load-Balance Awareness. | Zhen Xie, Jie Liu, Jiajia Li, Dong Li |
| 2023 | TDC: Towards Extremely Efficient CNNs on GPUs via Hardware-Aware Tucker Decomposition. | Lizhi Xiang, Miao Yin, Chengming Zhang, Aravind Sukumaran-Rajam, P. Sadayappan, Bo Yuan, Dingwen Tao |
| 2023 | End-to-End LU Factorization of Large Matrices on GPUs. | Yang Xia, Peng Jiang, Gagan Agrawal, Rajiv Ramnath |
| 2023 | Practically and Theoretically Efficient Garbage Collection for Multiversioning. | Yuanhao Wei, Guy E. Blelloch, Panagiota Fatourou, Eric Ruppert |
| 2023 | Harmonic CUDA: Asynchronous Programming on GPUs. | Jonathan D. Wapman, Sean Treichler, Serban D. Porumbescu, John D. Owens |
| 2023 | Provably Good Randomized Strategies for Data Placement in Distributed Key-Value Stores. | Zhe Wang, Jinhao Zhao, Kunal Agrawal, He Liu, Meng Xu, Jing Li |
| 2023 | PiPAD: Pipelined and Parallel Dynamic GNN Training on GPUs. | Chunyang Wang, Desen Sun, Yuebin Bai |
| 2023 | TGOpt: Redundancy-Aware Optimizations for Temporal Graph Attention Networks. | Yufeng Wang, Charith Mendis |
| 2023 | Transfer Learning Across Heterogeneous Features For Efficient Tensor Program Generation. | Gaurav Verma, Siddhisanket Raskar, Zhen Xie, Abid M. Malik, Murali Emani, Barbara M. Chapman |
| 2023 | The ERA Theorem for Safe Memory Reclamation. | Gali Sheffi, Erez Petrank |
| 2023 | MPI-based Remote OpenMP Offloading: A More Efficient and Easy-to-use Implementation. | Baodi Shan, Mauricio Araya-Polo, Abid M. Malik, Barbara M. Chapman |
| 2023 | OpenCilk: A Modular and Extensible Software Infrastructure for Fast Task-Parallel Code. | Tao B. Schardl, I-Ting Angelina Lee |
| 2023 | Efficient Direct Convolution Using Long SIMD Instructions. | Alexandre de Limas Santana, Adri Armejach, Marc Casas |
| 2023 | The State-of-the-Art LCRQ Concurrent Queue Algorithm Does NOT Require CAS2. | Raed Romanov, Nikita Koval |
| 2023 | Towards Maximum Throughput of Dataflow Software Pipeline under Resource Constraints. | Siddhisanket Raskar, Thomas Applencourt, Kalyan Kumaran, Guang Gao |
| 2023 | 2PLSF: Two-Phase Locking with Starvation-Freedom. | Pedro Ramalhete, Andreia Correia, Pascal Felber |