| 2021 | Optimizing Work Stealing Communication with Structured Atomic Operations. | Hannah Cartier, James Dinan, D. Brian Larkins |
| 2021 | Efficiently Parallelizable Strassen-Based Multiplication of a Matrix by its Transpose. | Viviana Arrigoni, Filippo Maggioli, Annalisa Massini, Emanuele Rodol |
| 2021 | An Evaluation of Task-Parallel Frameworks for Sparse Solvers on Multicore and Manycore CPU Architectures. | Abdullah Alperen, Md. Afibuzzaman, Fazlay Rabbi, M. Yusuf zkaya, mit V. atalyrek, Hasan Metin Aktulga |
| 2021 | SPMFS: A Scalable Persistent Memory File System on Optane Persistent Memory. | Yang Yang, Qiang Cao, Jie Yao, Yuanyuan Dong, Weikang Kong |
| 2021 | Sparker: Efficient Reduction for More Scalable Machine Learning with Spark. | Bowen Yu, Huanqi Cao, Tianyi Shan, Haojie Wang, Xiongchao Tang, Wenguang Chen |
| 2021 | Interferences between Communications and Computations in Distributed HPC Systems. | Alexandre Denis, Emmanuel Jeannot, Philippe Swartvagher |
| 2021 | Fast and Scalable Sparse Triangular Solver for Multi-GPU Based HPC Architectures. | Chenhao Xie, Jieyang Chen, Jesun Firoz, Jiajia Li, Shuaiwen Leon Song, Kevin J. Barker, Mark Raugas, Ang Li |
| 2020 | Detecting Anomalous Computation with RNNs on GPU-Accelerated HPC Machines. | Pengfei Zou, Ang Li, Kevin J. Barker, Rong Ge |
| 2020 | DQEMU: A Scalable Emulator with Retargetable DBT on Distributed Platforms. | Ziyi Zhao, Zhang Jiang, Ximing Liu, Xiaoli Gong, Wenwen Wang, Pen-Chung Yew |
| 2020 | An Online Learning-Based Task Offloading Framework for 5G Small Cell Networks. | Xueying Zhang, Ruiting Zhou, Zhi Zhou, John C. S. Lui, Zongpeng Li |
| 2020 | Adaptive Distributed Convolutional Neural Network Inference at the Network Edge with ADCNN. | Sai Qian Zhang, Jieyu Lin, Qi Zhang |
| 2020 | SkyChain: A Deep Reinforcement Learning-Empowered Dynamic Blockchain Sharding System. | Jianting Zhang, Zicong Hong, Xiaoyu Qiu, Yufeng Zhan, Song Guo, Wuhui Chen |
| 2020 | On Network Locality in MPI-Based HPC Applications. | Felix Zahn, Holger Frning |
| 2020 | Adaptive Bulk Search: Solving Quadratic Unconstrained Binary Optimization Problems on Multiple GPUs. | Ryota Yasudo, Koji Nakano, Yasuaki Ito, Masaru Tatekawa, Ryota Katsuki, Takashi Yazane, Yoko Inaba |
| 2020 | Dual-Way Gradient Sparsification for Asynchronous Distributed Deep Learning. | Zijie Yan, Danyang Xiao, Mengqiang Chen, Jieying Zhou, Weigang Wu |
| 2020 | Performance Portable Supernode-based Sparse Triangular Solver for Manycore Architectures. | Ichitaro Yamazaki, Sivasankaran Rajamanickam, Nathan D. Ellingwood |
| 2020 | Huffman Coding with Gap Arrays for GPU Acceleration. | Naoya Yamamoto, Koji Nakano, Yasuaki Ito, Daisuke Takafuji, Akihiko Kasagi, Tsuguchika Tabaru |
| 2020 | SWMapper: Scalable Read Mapper on SunWay TaihuLight. | Kai Xu, Xiaohui Duan, Xiangxu Meng, Xin Li, Bertil Schmidt, Weiguo Liu |
| 2020 | Parallel Shift-Invert Spectrum Slicing on Distributed Architectures with GPU Accelerators. | David B. Williams-Young, Chao Yang |
| 2020 | CCHL: Compression-Consolidation Hardware Logging for Efficient Failure-Atomic Persistent Memory Updates. | Xueliang Wei, Dan Feng, Wei Tong, Jingning Liu, Chengning Wang, Liuqing Ye |
| 2020 | DIESEL: A Dataset-Based Distributed Storage and Caching System for Large-Scale Deep Learning Training. | Lipeng Wang, Songgao Ye, Baichen Yang, Youyou Lu, Hequan Zhang, Shengen Yan, Qiong Luo |
| 2020 | An Adaptive Erasure-Coded Storage Scheme with an Efficient Code-Switching Algorithm. | Zizhong Wang, Haixia Wang, Airan Shao, Dongsheng Wang |
| 2020 | A Reinforcement Learning Based System for Minimizing Cloud Storage Service Cost. | Haoyu Wang, Haiying Shen, Qi Liu, Kevin Zheng, Jie Xu |
| 2020 | Prune the Unnecessary: Parallel Pull-Push Louvain Algorithms with Automatic Edge Pruning. | Jesmin Jahan Tithi, Andrzej Stasiak, Sriram Aananthakrishnan, Fabrizio Petrini |
| 2020 | Balancing Fairness and Efficiency for Cache Sharing in Semi-external Memory System. | Shanjiang Tang, Qifei Chai, Ce Yu, Yusen Li, Chao Sun |