| 2026 | Repurposing the Cross-Segment Space on Sunway SW26010Pro for MC-Balanced Bigshare Execution. | Qixin Chang, Lifeng Yan, Hailong Liu, Weiguo Liu, Xiaohui Duan |
| 2026 | Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters. | Zihan Chang, Sheng Xiao, Shuibing He, Xuechen Zhang, Siling Yang, Zhenxin Li, Zhe Pan, Weijian Chen |
| 2026 | Hierarchical Recursive Precision for Accelerating Symmetric Linear Solves on MXUs. | Vicki Carrica, Rabab Alomairy, Evelyne Ringoot, Alan Edelman |
| 2026 | CASTM: An API for Accelerating Zero-Knowledge Proof Kernels on CGRA Architectures. | Cristian Campos, Angeles G. Navarro, Sonia Gonzalez-Navarro |
| 2026 | QSplit: A Workflow-Oriented Hybrid Quantum-Classical Optimization Framework. | Mario Bifulco, Francesco Medina, Doriana Medic, Luca Roversi, Marco Aldinucci |
| 2026 | Throughput Optimization for Multi-level Speculative Decoding. | Anne Benoit, Loris Marchal, Adrien Obrecht |
| 2026 | SuperSFL: Resource-Heterogeneous Federated Split Learning with Weight-Sharing Supernet. | Abdullah Al Asif, Sixing Yu, Juan Pablo Muoz, Arya Mazaheri, Ali Jannesari |
| 2026 | JAX vs Kokkos Performance Comparison: A Magnetohydrodynamic Solver Case Study. | Thierry Antoun, Rmi Bourgeois, Pascal Tremblin, Samuel Kokh, Jrme Bobin |
| 2026 | SISA: A Scale-In Systolic Array for GEMM Acceleration. | Luigi Altamura, Alessio Cicero, Mateo Vzquez Maceiras, Mohammad Ali Maleki, Pedro Trancoso |
| 2026 | How Efficient are the Efficient Cores? - An Experimental Evaluation of Energy Efficiency in Asymmetric Multicore Processors. | Hana Shatri Ahmeti, Matthias Korch, Tim Werner, Thomas Rauber |
| 2026 | Sufficiency in Data Centers: Energy Aware Resource Recommendation System. | Eyvaz Ahmadzada, Patricia Stolf, Jean-Marc Pierson, Laurent Lefvre |
| 2026 | Fast Checkpointing in Disaggregated Persistent Memory. | Ivane Adam, Thomas Ropars, Nol De Palma |
| 2025 | Saving Memory via Residual Reduction for DNN Training with Compressed Communication. | Xinjue Zheng, Zhangqiang Ming, Yuchong Hu, Chenxuan Yao, Wenxiang Zhou, Rui Wang, Xun Chen, Dan Feng |
| 2025 | Quantum Delta Encoding: Optimizing Data Storage on Quantum Computers with Resource Efficiency. | Jiale Zhang, Xilong Che, Yuzhe Fan, Juncheng Hu |
| 2025 | Cocache: An Accurate and Low-Overhead Dynamic Caching Method for GNNs. | Zhaoyang Zeng, Yujuan Tan, Jiali Li, Zhuoxin Bai, Jun Liu, Kan Zhong, Duo Liu, Ao Ren |
| 2025 | SWBWA: A Highly Efficient NGS Aligner on the New Sunway Architecture. | Lifeng Yan, Zekun Yin, Qixin Chang, Tong Zhang, Zhisong Wang, Xiaohui Duan, Bertil Schmidt, Weiguo Liu |
| 2025 | SQ-DeAR: Sparsified and Quantized Gradient Compression for Distributed Training. | Xinrui Yang, Shaohuai Shi |
| 2025 | MPLS: Stacking Diverse Layers Into One Model for Decentralized Federated Learning. | Yang Xu, Zhiwei Yao, Hongli Xu, Yunming Liao, Zuan Xie |
| 2025 | SimPoint+: More Stable, Accurate and Efficient Program Analysis. | Jiangying Xue, Tianyu Xiong, Lingwei Chao, Ruini Xue |
| 2025 | SONet: Towards Practical Online Neural Network for Enhancing Hard-to-Predict Branches. | Zhenxuan Xiong, Libo Huang, Ling Yang, Hui Guo, Junhui Wang, Zhong Zheng, Songwen Pei, Gang Chen, Yongwen Wang |
| 2025 | CacheC: LLM-Based GPU Cache Management to Enhance Kernel Concurrency. | Mengyue Xi, Jingyi He, Xianwei Zhang |
| 2025 | Scheduling Task and Data Parallelism in Array Languages with Work Assisting. | Ivo Gabe de Wolff, David P. van Balen, Gabriele K. Keller |
| 2025 | ScaleRunner: A Fast MPI-Based Random Walk Engine for Multi-CPU Systems. | Florian Willich, Henning Meyerhenke |
| 2025 | Accelerating Independent Multi-Agent Reinforcement Learning on Multi-GPU Platforms. | Samuel Wiggins, Nikunj Gupta, Grace Zgheib, Mahesh A. Iyer, Viktor K. Prasanna |
| 2025 | AlphaSparseTensor: Discovering Faster Sparse Matrix Multiplication Algorithms on GPUs for LLM Inference. | Xuanzheng Wang, Shuo Miao, Zihan Zhu, Peng Qu, Youhui Zhang |