| 2022 | LOTUS: locality optimizing triangle counting. | Mohsen Koohi Esfahani, Peter Kilpatrick, Hans Vandierendonck |
| 2022 | The SuperCodelet architecture. | Jose Manuel Monsalve Diaz, Kevin Harms, Rafael A. Herrera Guaitero, Diego A. Roa Perdomo, Kalyan Kumaran, Guang R. Gao |
| 2022 | Deadlock-free asynchronous message reordering in rust with multiparty session types. | Zak Cutner, Nobuko Yoshida, Martin Vassor |
| 2022 | Dopia: online parallelism management for integrated CPU/GPU architectures. | Younghyun Cho, Jiyeon Park, Florian Negele, Changyeon Jo, Thomas R. Gross, Bernhard Egger |
| 2022 | Optimizing sparse computations jointly. | Kazem Cheshmi, Michelle Mills Strout, Maryam Mehri Dehnavi |
| 2022 | Scaling graph traversal to 281 trillion edges with 40 million cores. | Huanqi Cao, Yuanwei Wang, Haojie Wang, Heng Lin, Zixuan Ma, Wanwang Yin, Wenguang Chen |
| 2022 | Design and analysis of CXL performance models for tightly-coupled heterogeneous computing. | Anthony M. Cabrera, Aaron R. Young, Jeffrey S. Vetter |
| 2022 | Near LLC versus near main memory processing. | Hossein BiTalebi, Vahid Geraeinejad, Masoumeh Ebrahimi |
| 2022 | Lock-free locks revisited. | Naama Ben-David, Guy E. Blelloch, Yuanhao Wei |
| 2022 | Detectable recovery of lock-free data structures. | Hagit Attiya, Ohad Ben-Baruch, Panagiota Fatourou, Danny Hendler, Eleftherios Kosmas |
| 2022 | The problem-based benchmark suite (PBBS), V2. | Daniel Anderson, Guy E. Blelloch, Laxman Dhulipala, Magdalen Dobson, Yihan Sun |
| 2022 | Benchmarking Apache Arrow Flight - A wire-speed protocol for data transfer, querying and microservices. | Tanveer Ahmad |
| 2022 | CASE: a compiler-assisted SchEduling framework for multi-GPU systems. | Chao Chen, Chris Porter, Santosh Pande |
| 2022 | Near-optimal sparse allreduce for distributed deep learning. | Shigang Li, Torsten Hoefler |
| 2022 | PathCAS: an efficient middle ground for concurrent search data structures. | Trevor Brown, William Sigouin, Dan Alistarh |
| 2022 | Automatic synthesis of parallel unix commands and pipelines with KumQuat. | Jiasi Shen, Martin C. Rinard, Nikos Vasilakis |
| 2022 | wCQ: a fast wait-free queue with bounded memory usage. | Ruslan Nikolaev, Binoy Ravindran |
| 2022 | RTNN: accelerating neighbor search using hardware ray tracing. | Yuhao Zhu |
| 2021 | Improving communication by optimizing on-node data movement with data layout. | Tuowen Zhao, Mary W. Hall, Hans Johansen, Samuel Williams |
| 2021 | I/O lower bounds for auto-tuning of convolutions in CNNs. | Xiaoyang Zhang, Junmin Xiao, Guangming Tan |
| 2021 | An efficient uncertain graph processing framework for heterogeneous architectures. | Heng Zhang, Lingda Li, Donglin Zhuang, Rui Liu, Shuang Song, Dingwen Tao, Yanjun Wu, Shuaiwen Leon Song |
| 2021 | Investigating the semantics of futures in transactional memory systems. | Jingna Zeng, Shady Issa, Paolo Romano, Lus E. T. Rodrigues, Seif Haridi |
| 2021 | DFOGraph: an I/O- and communication-efficient system for distributed fully-out-of-core graph processing. | Jiping Yu, Wei Qin, Xiaowei Zhu, Zhenbo Sun, Jianqiang Huang, Xiaohan Li, Wenguang Chen |
| 2021 | Exploring deep reuse in winograd CNN inference. | Ruofan Wu, Feng Zhang, Zhen Zheng, Xiaoyong Du, Xipeng Shen |
| 2021 | Are dynamic memory managers on GPUs slow?: a survey and benchmarks. | Martin Winter, Mathias Parger, Daniel Mlakar, Markus Steinberger |