| 2016 | Hybrid CPU-GPU scheduling and execution of tree traversals. | Jianqiao Liu, Nikhil Hegde, Milind Kulkarni |
| 2016 | SFU-Driven Transparent Approximation Acceleration on GPUs. | Ang Li, Shuaiwen Leon Song, Mark Wijtvliet, Akash Kumar, Henk Corporaal |
| 2016 | Tag-Split Cache for Efficient GPGPU Cache Utilization. | Lingda Li, Ari B. Hayes, Shuaiwen Leon Song, Eddy Z. Zhang |
| 2016 | Galaxyfly: A Novel Family of Flexible-Radix Low-Diameter Topologies for Large-Scales Interconnection Networks. | Fei Lei, Dezun Dong, Xiangke Liao, Xing Su, Cunlu Li |
| 2016 | Peruse and Profit: Estimating the Accelerability of Loops. | Snehasish Kumar, Vijayalakshmi Srinivasan, Amirali Sharifian, Nick Sumner, Arrvindh Shriraman |
| 2016 | Fairness-oriented OS Scheduling Support for Multicore Systems. | Changdae Kim, Jaehyuk Huh |
| 2016 | Proteus: Exploiting Numerical Precision Variability in Deep Neural Networks. | Patrick Judd, Jorge Albericio, Tayler H. Hetherington, Tor M. Aamodt, Natalie D. Enright Jerger, Andreas Moshovos |
| 2016 | Reusing Data Reorganization for Efficient SIMD Parallelization of Adaptive Irregular Applications. | Peng Jiang, Linchuan Chen, Gagan Agrawal |
| 2016 | High Performance Design for HDFS with Byte-Addressability of NVM and RDMA. | Nusrat Sharmin Islam, Md. Wasi-ur-Rahman, Xiaoyi Lu, Dhabaleswar K. Panda |
| 2016 | HOPE: Enabling Efficient Service Orchestration in Software-Defined Data Centers. | Yang Hu, Chao Li, Longjun Liu, Tao Li |
| 2016 | Polly-ACC Transparent compilation to heterogeneous hardware. | Tobias Grosser, Torsten Hoefler |
| 2016 | Mini-Ckpts: Surviving OS Failures in Persistent Memory. | David Fiala, Frank Mueller, Kurt B. Ferreira, Christian Engelmann |
| 2016 | TokenTLB: A Token-Based Page Classification Approach. | Albert Esteve, Alberto Ros, Antonio Robles, Mara Engracia Gmez, Jos Duato |
| 2016 | Exploiting Private Local Memories to Reduce the Opportunity Cost of Accelerator Integration. | Emilio G. Cota, Paolo Mantovani, Luca P. Carloni |
| 2016 | Coherence-Free Multiview: Enabling Reference-Discerning Data Placement on GPU. | Guoyang Chen, Xipeng Shen |
| 2016 | Runtime-Guided Mitigation of Manufacturing Variability in Power-Constrained Multi-Socket NUMA Nodes. | Dimitrios Chasapis, Marc Casas, Miquel Moret, Martin Schulz, Eduard Ayguad, Jess Labarta, Mateo Valero |
| 2016 | Simulation and Analysis Engine for Scale-Out Workloads. | Nadav Chachmon, Daniel Richins, Robert S. Cohn, Magnus Christensson, Wenzhi Cui, Vijay Janapa Reddi |
| 2016 | Optimizing Sparse Matrix-Vector Multiplication for Large-Scale Data Analytics. | Daniele Buono, Fabrizio Petrini, Fabio Checconi, Xing Liu, Xinyu Que, Chris Long, Tai-Ching Tuan |
| 2016 | Fast Multiplication in Binary Fields on GPUs via Register Cache. | Eli Ben-Sasson, Matan Hamilis, Mark Silberstein, Eran Tromer |
| 2016 | CuMAS: Data Transfer Aware Multi-Application Scheduling for Shared GPUs. | Mehmet E. Belviranli, Farzad Khorasani, Laxmi N. Bhuyan, Rajiv Gupta |
| 2016 | Write-Aware Management of NVM-based Memory Extensions. | Amro Awad, Sergey Blagodurov, Yan Solihin |
| 2016 | Balanced Hashing and Efficient GPU Sparse General Matrix-Matrix Multiplication. | Pham Nguyen Quang Anh, Rui Fan, Yonggang Wen |
| 2016 | Graph Prefetching Using Data Structure Knowledge. | Sam Ainsworth, Timothy M. Jones |
| 2016 | Variation Among Processors Under Turbo Boost in HPC Systems. | Bilge Acun, Phil Miller, Laxmikant V. Kal |
| 2016 | Origami: Folding Warps for Energy Efficient GPUs. | Mohammad Abdel-Majeed, Daniel Wong, Justin Kuang, Murali Annavaram |