| 2026 | Performance Characterization and Optimization of LLM Inference on Tenstorrent AI Accelerators. | Jangho Lim, Dongin Shin, Uichan Kim, Jinhyeok Choi, Kyung Min Kim, Sangwon Shin, Sangwoo Park, Gunjae Koo, Taeweon Suh |
| 2026 | SET: Stream-Event-Triggered Scheduling for Efficient CUDA Graph Pipelines. | Zhengxiong Li, Tsung-Wei Huang, Umit Yusuf Ogras |
| 2026 | TAIN: Scalable Tensor-Aware Acceleration for Quantum Chemistry on Heterogeneous Architectures. | Wenhao Liang, Lianhua He, Runfeng Jin, Yingqi Tian, Yidong Chen, Yingjin Ma, Zhong Jin |
| 2026 | Backend Code Generation for Graph DSLs Targeting Diverse Accelerator Platforms. | Ashwina Kumar, M. Venkata Krishna, Prasanna Bartakke, Mathew Thomas, Rahul Kumar, Rajesh Pandian Muniasamy, Nibedita Behera, Rupesh Nasre |
| 2026 | An Event-Based Causality Model for Mobile Multiagent Systems. | Ajay D. Kshemkalyani, Anshuman Misra |
| 2026 | A Compiler-Assisted Workflow for Efficiency-Guided Selective Tracing. | Sebastian Kreutzer, Valentin Seitz, Joan Vinyals, Tim Heldmann, Christian Iwainsky, Marta Garcia, Jess Labarta, Christian H. Bischof |
| 2026 | Harmonia: QoS-Aware and High-Throughput Generative Inference with a Single GPU. | Sowoong Kim, Youngsam Shin, YeonGon Cho, Woongki Baek |
| 2026 | Two-Stage Hierarchy-Aware Learning with Gradient Conflict Mitigation for HLS Latency and Resource Prediction. | Zhiwei Ke, Yiming Liu, Fengrui Zuo, Wenqi Lou, Chao Wang, Xuehai Zhou |
| 2026 | Adaptive Data Augmentation with Bayesian Optimization for Basic Block Throughput Prediction. | Xiabing Hu, Xuezheng Xu, Deheng Yang, Bowen Liu, Chun Huang, Qiong Li |
| 2026 | TBF: A Tunable Blocking-and-Fusion Algorithm for Efficient GPU Symmetric Rank-2K Updates. | Lijuan Hu, Xinzhe Chen, Haowei Li, Hongyaoxing Gu, Wenjing Ma, Fangfang Liu, Cui Wang, Yuwen Zhao |
| 2026 | DACOS: Dependency-Aware Cross-Kernel Overlapping for Optimizing Short-Sequence Workloads in LLM Applications. | Zhaoyang Hao, Guangli Li, Fan Luo, Hao Qian, Xueying Wang, Jiacheng Zhao, Xiaobing Feng, Huimin Cui, Jingling Xue |
| 2026 | NeuroRing: Scaling Spiking Neural Networks via Multi-FPGA Bidirectional Ring Topologies and Stream-Dataflow Architectures. | Muhammad Ihsan Al Hafiz, Artur Podobas |
| 2026 | Privacy-Preserving Data Center Demand Response Using Multi-party Computation. | Seyda Nur Gzelhan, Fatih Acun, Can Hankendi, Ayse K. Coskun, Ajay Joshi |
| 2026 | ApproxRAG: A Systematic Framework for Mitigating I/O Overheads in Retrieval-Augmented Generation. | Danying Ge, Qizhi Jiang, Jianhua Gao, Jianjun Shi, Weixing Ji |
| 2026 | Performance Evaluation of a CPU-GPU Coprocessing-Based Simulation Software on Converged Computing Architectures. | Romain Gall, Jonathan Rouzaud-Cornabas, Thierry Gautier |
| 2026 | MemBridge: Bridging the Static-Dynamic Semantic Gap in Memory Profiling via Variable-Centric Instrumentation. | Wentao Feng, Shaowen Li, Ziyi Song, Shizhe Shang, Kuiying Ban, Zhongyu Yu, Jiaxing Qi, Zhongzhi Luan, Hailong Yang, Depei Qian |
| 2026 | Optimizing SpMV Kernel for Banded Matrices on FPGAs Using High-Level Synthesis. | Federico Favaro, Ernesto Dufrechou, Juan P. Oliver, Pablo Ezzatti |
| 2026 | MatrixFold: Unleashing Manycore CPUs with Outer-Product Units for Mixed-Precision AlphaFold Inference. | Shaokang Du, Hailong Yang, Tao Lu, Xin You, Baojian Zhou, Depei Qian |
| 2026 | Static Scheduling of DAG Workflows on Homogeneous Parallel Platforms Using Longest Betweenness Centrality. | Niek Damink, Alberto Garcia-Robledo, Mahboobeh Zangiabady |
| 2026 | Dodoor: Efficient Randomized Decentralized Scheduling with Load Caching for Heterogeneous Tasks and Clusters. | Wei Da, Evangelia Kalyvianaki |
| 2026 | RAGNN: A Resource-Aware System for Graph Neural Network Training at Scale. | Phivos Dadamis, Dimitrios Tomaras, Vana Kalogeraki, Dimitrios Gunopulos |
| 2026 | When Faster Kernels Do Not Mean Faster Applications in Exascale GPU Systems. | Mariana Toledo Costa, Antigoni Georgiadou, James B. White, Woong Shin, Bruno Villasenor Alvarez, Jord Polo, Karl W. Schulz, Philippe O. A. Navaux, Bronson Messer, Arthur Francisco Lorenzon |
| 2026 | S-CQR: Stratified Calibration for Runtime Prediction in HPC Backfill Scheduling. | Jiheon Choi, Sangyoon Oh |
| 2026 | Assessing the Performance Impact of Data Layouts: a Benchmarking Approach. | Jolly Chen, Ana Lucia Varbanescu, Axel Naumann |
| 2026 | AtSpMV: Model-Guided Adaptive Tiling and Load Balancing for SpMV on GPUs. | Jiajun Cheng, Junshi Chen, Qi Li, Longsheng Song, Yang Zhao, Jun Shi, Xiaoyu Hao, Hong An |