| 2019 | Controlled Asynchronous GVT: Accelerating Parallel Discrete Event Simulation on Many-Core Clusters. | Ali Eker, Barry Williams, Kenneth Chiu, Dmitry Ponomarev |
| 2019 | Data and Thread Placement in NUMA Architectures: A Statistical Learning Approach. | Nicolas Denoyelle, Brice Goglin, Emmanuel Jeannot, Thomas Ropars |
| 2019 | Holistic Slowdown Driven Scheduling and Resource Management for Malleable Jobs. | Marco D'Amico, Ana Jokanovic, Julita Corbaln |
| 2019 | I/O Characterization and Performance Evaluation of BeeGFS for Deep Learning. | Fahim Chowdhury, Yue Zhu, Todd Heer, Saul Paredes, Adam Moody, Robin Goldstone, Kathryn Mohror, Weikuan Yu |
| 2019 | Faster parallel collision detection at high resolution for CNC milling applications. | Xin Chen, Dmytro Konobrytskyi, Thomas M. Tucker, Thomas R. Kurfess, Richard W. Vuduc |
| 2019 | DLBooster: Boosting End-to-End Deep Learning Workflows with Offloading Data Preprocessing Pipelines. | Yang Cheng, Dan Li, Zhiyuan Guo, Binyao Jiang, Jiaxin Lin, Xi Fan, Jinkun Geng, Xinyi Yu, Wei Bai, Lei Qu, Ran Shu, Peng Cheng, Yongqiang Xiong, Jianping Wu |
| 2019 | Accelerating All-Edge Common Neighbor Counting on Three Processors. | Yulin Che, Zhuohang Lai, Shixuan Sun, Qiong Luo, Yue Wang |
| 2019 | AdaM: An Adaptive Fine-Grained Scheme for Distributed Metadata Management. | Shiyi Cao, Yuanning Gao, Xiaofeng Gao, Guihai Chen |
| 2019 | BCL: A Cross-Platform Distributed Data Structures Library. | Benjamin Brock, Aydin Bulu, Katherine A. Yelick |
| 2019 | A Parallel Graph Algorithm for Detecting Mesh Singularities in Distributed Memory Ice Sheet Simulations. | Ian Bogle, Karen D. Devine, Mauro Perego, Sivasankaran Rajamanickam, George M. Slota |
| 2019 | Improved Unconstrained Energy Functional Method for Eigensolvers in Electronic Structure Calculations. | Mauro Del Ben, Osni Marques, Andrew Canning |
| 2019 | Optimized Execution of Parallel Loops via User-Defined Scheduling Policies. | Seonmyeong Bak, Yanfei Guo, Pavan Balaji, Vivek Sarkar |
| 2019 | Fast Recovery Techniques for Erasure-coded Clusters in Non-uniform Traffic Network. | Yunren Bai, Zihan Xu, Haixia Wang, Dongsheng Wang |
| 2019 | Nested Virtualization Without the Nest. | Mathieu Bacou, Grgoire Todeschi, Alain Tchana, Daniel Hagimont |
| 2019 | SaC: Exploiting Execution-Time Slack to Save Energy in Heterogeneous Multicore Systems. | Muhammad Waqar Azhar, Miquel Perics, Per Stenstrm |
| 2019 | HPAS: An HPC Performance Anomaly Suite for Reproducing Performance Variations. | Emre Ates, Yijia Zhang, Burak Aksar, Jim M. Brandt, Vitus J. Leung, Manuel Egele, Ayse K. Coskun |
| 2018 | Improving First Level Cache Efficiency for GPUs Using Dynamic Line Protection. | Xian Zhu, Robert Wernsman, Joseph Zambreno |
| 2018 | Energy-Efficient Speculative Execution using Advanced Reservation for Heterogeneous Clusters. | Amelie Chi Zhou, Tien-Dat Phan, Shadi Ibrahim, Bingsheng He |
| 2018 | C-Graph: A Highly Efficient Concurrent Graph Reachability Query Framework. | Li Zhou, Ren Chen, Yinglong Xia, Radu Teodorescu |
| 2018 | PBCS: An Efficient Parallel Characteristic Set Method for Solving Boolean Polynomial Systems. | Juan Zhao, Junqiang Song, Min Zhu, Jincai Li, Zhenyu Huang, Xiaoyong Li, Xiaoli Ren |
| 2018 | H2Cloud: Maintaining the Whole Filesystem in an Object Storage Cloud. | Minghao Zhao, Zhenhua Li, Ennan Zhai, Gareth Tyson, Chen Qian, Zhenyu Li, Leiyu Zhao |
| 2018 | Learning Driven Parallelization for Large-Scale Video Workload in Hybrid CPU-GPU Cluster. | Haitao Zhang, Bingchang Tang, Xin Geng, Huadong Ma |
| 2018 | Vectorized Parallel Sparse Matrix-Vector Multiplication in PETSc Using AVX-512. | Hong Zhang, Richard Tran Mills, Karl Rupp, Barry F. Smith |
| 2018 | Performance & Energy Tradeoffs for Dependent Distributed Applications Under System-wide Power Caps. | Huazhe Zhang, Henry Hoffmann |
| 2018 | FFS-VA: A Fast Filtering System for Large-scale Video Analytics. | Chen Zhang, Qiang Cao, Hong Jiang, Wenhui Zhang, Jingjun Li, Jie Yao |