| 2021 | PLANAR: a programmable accelerator for near-memory data rearrangement. | Adrin Barredo, Adri Armejach, Jonathan C. Beard, Miquel Moret |
| 2021 | Task-graph scheduling extensions for efficient synchronization and communication. | Seonmyeong Bak, Oscar R. Hernandez, Mark Gates, Piotr Luszczek, Vivek Sarkar |
| 2021 | A performance portability framework for Python. | Nader Al Awar, Steven Zhu, George Biros, Milos Gligoric |
| 2021 | ProMT: optimizing integrity tree updates for write-intensive pages in secure NVMs. | Mazen Al-Wadi, Aziz Mohaisen, Amro Awad |
| 2021 | Tile size selection of affine programs for GPGPUs using polyhedral cross-compilation. | Khaled Abdelaal, Martin Kong |
| 2021 | Sandslash: a two-level framework for efficient graph pattern mining. | Xuhao Chen, Roshan Dathathri, Gurbinder Gill, Loc Hoang, Keshav Pingali |
| 2020 | Tools for top-down performance analysis of GPU-accelerated applications. | Keren Zhou, Mark W. Krentel, John M. Mellor-Crummey |
| 2020 | TensorSVM: accelerating kernel machines with tensor engine. | Shaoshuai Zhang, Ruchi Shah, Panruo Wu |
| 2020 | How I learned to stop worrying about user-visible endpoints and love MPI. | Rohit Zambre, Aparna Chandramowlishwaran, Pavan Balaji |
| 2020 | Tuning applications for efficient GPU offloading to in-memory processing. | Yudong Wu, Mingyao Shen, Yi-Hui Chen, Yuanyuan Zhou |
| 2020 | Optimizing supercompilers for supercomputers. | Michael Wolfe |
| 2020 | Untitled record | Martin Winter, Daniel Mlakar, Mathias Parger, Markus Steinberger |
| 2020 | Identifying and (automatically) remedying performance problems in CPU/GPU applications. | Benjamin Welton, Barton P. Miller |
| 2020 | CodeSeer: input-dependent code variants selection via machine learning. | Tao Wang, Nikhil Jain, David Bhme, David Beckingsale, Frank Mueller, Todd Gamblin |
| 2020 | Graptor: efficient pull and push style vectorized graph processing. | Hans Vandierendonck |
| 2020 | Fuzzy fairness controller for NVMe SSDs. | Shivani Tripathy, Debiprasanna Sahoo, Manoranjan Satpathy, Madhu Mutyam |
| 2020 | What every scientific programmer should know about compiler optimizations? | Jialiang Tan, Shuyin Jiao, Milind Chabbi, Xu Liu |
| 2020 | BurstZ: a bandwidth-efficient scientific computing accelerator platform for large-scale data. | Gongjin Sun, Seongyoung Kang, Sang-Woo Jun |
| 2020 | Efficient parallel algorithms for betweenness- and closeness-centrality in dynamic graphs. | Kshitij Shukla, Sai Charan Regunta, Sai Harsh Tondomker, Kishore Kothapalli |
| 2020 | CSB-RNN: a faster-than-realtime RNN acceleration framework with compressed structured blocks. | Runbin Shi, Peiyan Dong, Tong Geng, Yuhao Ding, Xiaolong Ma, Hayden Kwok-Hay So, Martin C. Herbordt, Ang Li, Yanzhi Wang |
| 2020 | Wavefront parallelization of recurrent neural networks on multi-core architectures. | Robin Kumar Sharma, Marc Casas |
| 2020 | Chunking loops with non-uniform workloads. | Indu K. Prabhu, V. Krishna Nandivada |
| 2020 | CFDNet: a deep learning-based accelerator for fluid simulations. | Octavi Obiols-Sales, Abhinav Vishnu, Nicholas Malaya, Aparna Chandramowlishwaran |
| 2020 | cuRipples: influence maximization on multi-GPU systems. | Marco Minutoli, Maurizio Drocco, Mahantesh Halappanavar, Antonino Tumeo, Ananth Kalyanaraman |
| 2020 | AutoParBench: a unified test framework for OpenMP-based parallelizers. | Gleison Souza Diniz Mendonca, Chunhua Liao, Fernando Magno Quinto Pereira |