| 2026 | PIM-zd-tree: A Fast Space-Partitioning Index Leveraging Processing-in-Memory. | Yiwei Zhao, Hongbo Kang, Ziyang Men, Yan Gu, Guy E. Blelloch, Laxman Dhulipala, Charles McGuffey, Phillip B. Gibbons |
| 2026 | RoMeo: Mitigating Dual-dimensional Outliers with Rotated Mixed Precision Quantization. | Qihao Zhang, Mingliang Tang, Mingshu Zhai, Kinman Lei, Jidong Zhai |
| 2026 | Faster and Cheaper: Pushing the Sequence Alignment Throughput with Commercial CPUs. | Zhonghai Zhang, Yewen Li, Ke Meng, Chunming Zhang, Guangming Tan |
| 2026 | HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism. | Geng Zhang, Shenggan Cheng, Xuanlei Zhao, Ziming Liu, Yang You |
| 2026 | Exploiting Efficient Mapping and Pipelined Execution for Accelerating SpMV on Tensor Cores. | Kaige Zhang, Hailong Yang, Xin You, Tianyu Feng, Yufan Xu, Zhongzhi Luan, Yi Liu, Depei Qian |
| 2026 | A Diagonal Block Memory-Aware Polynomial Preconditioner for Linear and Eigenvalue Solvers. | Xiaojian Yang, Yuhui Ni, Fan Yuan, Shengguo Li, Dezun Dong, Chuanfu Xu, Haipeng Jia, Jie Liu |
| 2026 | FlashAttention-T: Towards Fully Tensorized Attention by Exploiting Tensor-Vector Parallelism. | Jianxing Xu, Yuanbo Wen, Jun Bi, Ruibai Xu, Guanglin Xu, Rui Zhang, Wei Li, Ling Li, Tianshi Chen, Qi Guo, Yunji Chen |
| 2026 | ChituDiffusion: A Data-Characteristic-Aware Serving System for Diffusion Models. | Chengzhang Wu, Liyan Zheng, Haojie Wang, Kezhao Huang, Zixuan Ma, Dong Dong, Jidong Zhai |
| 2026 | Concurrent Balanced Augmented Trees. | Evan Wrench, Ajay Singh, Younghun Roh, Panagiota Fatourou, Siddhartha Jayanti, Eric Ruppert, Yuanhao Wei |
| 2026 | Elastor: Elastic and Efficient Model Partitioning and Checkpointing for Fault-Tolerant Distributed Training. | Xuanyu Wang, Fangcheng Fu, Haoyang Li, Hao Ge, Sheng Lin, Jiawen Niu, Bin Cui |
| 2026 | APERTURE: Algorithm-System Co-optimization for Temporal Graph Network Inference. | Yiqing Wang, Hailong Yang, Enze Yu, Qingxiao Sun, Kejie Ma, Kaige Zhang, Chenhao Xie, Depei Qian |
| 2026 | ElasGNN: An Elastic Training Framework for Distributed GNN Training. | Siqi Wang, Hailong Yang, Pengbo Wang, Hongliang Cao, Yufan Xu, Xuezhu Wang, Zhongzhi Luan, Yi Liu, Depei Qian |
| 2026 | MixFusion: A Patch-Level Parallel Serving System for Mixed-Resolution Diffusion Models. | Desen Sun, Zepeng Zhao, Yuke Wang |
| 2026 | JanusQuant: Accurate and Efficient 2-bit KV Cache Quantization for Long-Context Inference. | Chengyu Sun, Yaqi Xia, Hulin Wang, Donglin Yang, Xiaobo Zhou, Dazhao Cheng |
| 2026 | HierCut: Enabling 16-bit Format Mixed Precision for Molecular Dynamics through Hierarchical Cutoff. | Zeyu Song, Lin Gan, Xiaohui Duan, Zhengrui Li, Jiayu Fu, Yinuo Wang, Guangzhao Li, Guangwen Yang |
| 2026 | Waste-Efficient Work Stealing. | Kyle Singer, Kunal Agrawal, Tao B. Schardl |
| 2026 | Towards Singular Value Decomposition for Rank-Deficient Matrices: An Efficient and Accurate Algorithm on GPU Architectures. | Lu Shi, Weiwei Xu, Shaoshuai Zhang |
| 2026 | BEEMS: Boosting Machine Vision Efficiency via Computation Graph-Based Memory Smoothing. | Hanjing Shen, Fangxin Liu, Jian Liu, Li Jiang, Haibing Guan |
| 2026 | Rethinking Thread Scheduling under Oversubscription: A User-Space Framework for Coordinating Multi-runtime and Multi-process Workloads. | Aleix Roca, Vicen Beltran |
| 2026 | Root-Down Exposure for Maximal Clique Enumeration on GPUs. | Zhe Pan, Peng Qu, Youhui Zhang |
| 2026 | DiggerBees: Depth First Search Leveraging Hierarchical Block-Level Stealing on GPUs. | Yuyao Niu, Yuechen Lu, Weifeng Liu, Marc Casas |
| 2026 | Parallel Dynamic Spatial Indexes. | Ziyang Men, Bo Huang, Yan Gu, Yihan Sun |
| 2026 | Dynamic Detection of Inefficient Data Mapping Patterns in Heterogeneous OpenMP Applications. | Luke Marzen, Junhyung Shim, Ali Jannesari |
| 2026 | UFO Trees: Practical and Provably-Efficient Parallel Batch-Dynamic Trees. | Quinten De Man, Atharva Sharma, Kishen N. Gowda, Laxman Dhulipala |
| 2026 | Characterizing Matrix Multiplication Units across General Parallel Patterns in Scientific Computing. | Yuechen Lu, Hongwei Zeng, Marc Casas, Weifeng Liu |