| 2026 | TADS: Trend-Aware Dynamic Load Balancing for Large-Scale SNN Simulations with Delay-Sharded Graph Infrastructure. | Hao Huang, Shangzhi Pang, Yangle Zeng, Guangnan Feng, Zhiguang Chen, Yutong Lu |
| 2026 | Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference. | Yafan Huang, Sheng Di, Guanpeng Li |
| 2026 | TuniQ: Autotuning Compilation Passes for Quantum Workloads at Scale for Effectiveness and Efficiency. | Mohammad Abrarul Hasanat, Jason Ludmir, Tirthak Patel, Rohan Basu Roy |
| 2026 | DistroMatch: Distributed Disjoint Weighted Matchings in Demand-Aware Reconfigurable Optical Datacenters. | Kathrin Hanauer, Sophia Heck, Stefan Schmid |
| 2026 | Destination Earth: Digital twins of the earth system on Europe's most powerful supercomputers. | Ioan Hadade |
| 2026 | An Open-Source-First Approach: Multi-Level Compiler Design for AI and HPC. | Tobias Grosser |
| 2026 | Scaling Long-Sequence Homomorphic Encrypted Transformer Inference via Hybrid Parallelism on Multi-GPU Systems. | Zhaoting Gong, Ran Ran, Fan Yao, Wujie Wen |
| 2026 | MPMOS: Massively Parallel Multi-Objective Shortest Paths. | Leo Gold, David Sidoti, Krishna R. Pattipati, Omer Khan |
| 2026 | X-HD: Fast Hausdorff Distance Computation with Ray Tracing. | Liang Geng, Zhehu Yuan, Rubao Lee, Fusheng Wang, Xiaodong Zhang |
| 2026 | FLYING SERVING: On-the-Fly Parallelism Switching for Large Language Model Serving. | Shouwei Gao, Junqi Yin, Feiyi Wang, Wenqian Dong |
| 2026 | Scalable, Portable and Live Nanopore Sequence Analysis: arch4health workshop paper. | Hasindu Gamaarachchi |
| 2026 | dLLM-Serve: Bridging the Memory Gap in Diffusion Language Model Serving. | Jiakun Fan, Yanglin Zhang, Xiangchen Li, Dimitrios S. Nikolopoulos |
| 2026 | FaaSlim: Partial Caching of Snapshot-based VMs for Serverless Computing. | Sanghyeon Eom, Chanyoung Park, Gihong Lee, Hyungon Moon, Young-ri Choi |
| 2026 | BLEST: Blazingly Efficient BFS using Tensor Cores. | Deniz Elbek, Kamer Kaya |
| 2026 | TenProf: A Tensor-Centric Profiler for Deep Learning Workload Analysis and Optimization. | Xingjian Ding, Keren Zhou, Yueming Hao, Pengfei Su |
| 2026 | StencilMD: Optimizing Communication in Molecular Dynamics Simulations. | Ryan Deng, Tao B. Schardl |
| 2026 | S2VEC: Compiler-Driven Stream Specialization for Linearized Vectorization. | Lus Crespo, Ana Fernandes, Gabriel Falco, Pedro Toms, Nuno Roma, Nuno Neves |
| 2026 | Diagonal-Budgeted Trotterization for Efficient Quantum Hamiltonian Simulation. | Srikar Chundury, Blake Burgstahler, Jiajia Li, In-Saeng Suh, Frank Mueller |
| 2026 | COMETS: Cost-effective Multi-node Efficient Training System with Memory Pooling and Sharing. | Hanqiu Chen, Shao-Peng Yang, Mohammadreza Soltaniyeh, Shuyi Pei, Andrew Chang, Bryan S. Kim, Cong Hao |
| 2026 | From Naive CUDA to Triton: A Systematic Evaluation of AI-Era HPC Operator Development. | Yixian Chen, Chunwei Xia |
| 2026 | DEFT: Joint Task Placement and DVFS for Energy-Efficient Multi-GPU Runtimes. | Jing Chen, Miquel Perics |
| 2026 | Parallel Query Processing through Optimal Key Grouping on GPU-Based B+-Trees. | Zhenyi Chen, Jiangbo Li, Jinghan Meng, Napath Pitaksirianan, Yicheng Tu, Bo Zeng, Chen Dong |
| 2026 | SPPO: Making Million-Token LLM Training Practical on Modest GPU Clusters. | Qiaoling chen, Shenggui Li, Wei Gao, Peng Sun, Yonggang Wen, Tianwei Zhang |
| 2026 | CoLo: Correcting LLM-Generated IR with Precise Error Location. | Jiahao Chen, Xianbo He, Lulin Wang |
| 2026 | G-PathGen: An Efficient GPU-Parallel k-Critical Path Generation Algorithm. | Che Chang, Yi-Hua Chung, Cheng-Hsiang Chiu, Wan-Luan Lee, Boyang Zhang, Ulf Schlichtmann, Ing-Chao Lin, Xiangyao Yu, Tsung-Wei Huang |