| 2025 | CoSF: A | Wei Li, Ao Ren, Qingqiu Lan, Haining Fang, Zhenyu Wang, Yujuan Tan, Kan Zhong, Duo Liu |
| 2025 | ScheInfer: Efficient Inference of Large Language Models with Task Scheduling on Moderate GPUs. | Wenxiang Lin, Xinglin Pan, Shaohuai Shi, Xuan Wang, Xiaowen Chu |
| 2025 | ParTEE: A Framework for Secure Parallel Computing of RISC-V Trusted Execution Environments. | Hao Lan, Ziang Zhou, Qi Zhu, Wei Yan, Qinfen Hao, Xiaochun Ye, Yong Liu, Ninghui Sun |
| 2025 | SkipNZ: Non-zero Value Skipping for Efficient CNN Acceleration. | Joonyup Kwon, Jinhyeok Choi, Ngoc-Son Pham, Sangwon Shin, Taeweon Suh |
| 2025 | KarmaPM: Reward-Driven Power Manager. | Sunil Kumar, Vivek Kumar |
| 2025 | SProBench: Stream Processing Benchmark for High Performance Computing Infrastructure. | Apurv Deepak Kulkarni, Siavash Ghiasvand |
| 2025 | Partitioning In-Place on Massively Parallel Architectures. | Thomas Koopman, Sven-Bodo Scholz, Bernard van Gastel |
| 2025 | An Autonomy Loop for Dynamic HPC Job Time Limit Adjustment. | Thomas Jakobsche, Osman Seckin Simsek, Jim M. Brandt, Ann C. Gentile, Florina M. Ciorba |
| 2025 | 2:4 Pruning on Edge Devices: Performance, Energy Efficiency and Accuracy. | Nicols Hernndez, Pedro A. Toledo, Vicente Blanco, Francisco Almeida |
| 2025 | HAS-GPU: Efficient Hybrid Auto-scaling with Fine-Grained GPU Allocation for SLO-Aware Serverless Inferences. | Jianfeng Gu, Puxuan Wang, Isaac David Nez Araya, Kai Huang, Michael Gerndt |
| 2025 | EFIM: Efficient Serving of LLMs for Infilling Tasks with Improved KV Cache Reuse. | Tianyu Guo, Hande Dong, Yichong Leng, Feng Liu, Cheater Lin, Nong Xiao, Xianwei Zhang |
| 2025 | Design and Operation of Elastic GPU-Pooling on Campus. | Kaicheng Guo, Jingyi Chen, Yun Wang, Semakin Anton, Tovmachenko Dmitry, Jiajie Sheng, Jianwen Wei, James Lin, Zhengwei Qi, Haibing Guan |
| 2025 | Light-DiT: An Importance-Aware Dynamic Compression Framework for Diffusion Transformers. | Cheng Gu, Gang Li, Xuan Zhang, Jiayao Ling, Xiaolong Lin, Zhuoran Song, Jian Cheng, Xiaoyao Liang |
| 2025 | Byzantine-Tolerant Consensus in GPU-Inspired Shared Memory. | Chryssis Georgiou, Manaswini Piduguralla, Sathya Peri |
| 2025 | Interval-Asynchrony: Delimited Intervals of Localised Asynchrony for Fast Parallel SGD. | Jacob Garby, Philippas Tsigas |
| 2025 | Priority-BF: A Task Manager for Priority-Based Scheduling. | Ana Gainaru, Scott Klasky, Guillaume Pallez |
| 2025 | DiffNO: Neural Operator Learning Using Physically Structured Constrained Diffusion Model. | Zhichen Feng, Xin Zhang |
| 2025 | CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGA. | Jiale Dong, Hao Wu, Zihao Wang, Wenqi Lou, Zhendong Zheng, Lei Gong, Chao Wang, Xuehai Zhou |
| 2025 | A Sparsity Predicting Approach for Large Language Models via Activation Pattern Clustering. | Nobel Dhar, Bobin Deng, Md. Romyull Islam, Xinyue Zhang, Kazi Fahim Ahmad Nasif, Kun Suo |
| 2025 | Noise Injection for Performance Bottleneck Analysis. | Aurlien Delval, Pablo de Oliveira Castro, William Jalby, Etienne Renault |
| 2025 | Bifrst: Peer-to-Peer Load-Balancing for Function Execution in Agentic AI Systems. | Giuseppe Coviello, Kunal Rao, Mohammad Amir Khojastepour, Srimat Chakradhar |
| 2025 | Scalable OpenMP Remote Offloading via Asynchronous MPI and Coroutine-Driven Communication. | Jhonatan Clto, Guilherme Valarini, Mrcio Machado Pereira, Guido Araujo, Herv Yviquel |
| 2025 | SimPart: A Simple Yet Effective Replication-Aided Partitioning Algorithm for Logic Simulation on GPU. | Yi-Hua Chung, Shui Jiang, Wan-Luan Lee, Yanqing Zhang, Haoxing Ren, Tsung-Yi Ho, Tsung-Wei Huang |
| 2025 | TopServe: Task-Operator Co-scheduling for Efficient Multi-DNN Inference Serving on GPUs. | Ao Chen, Guangli Li, Feng Yu, Xueying Wang, Jiacheng Zhao, Huimin Cui, Xiaobing Feng, Jingling Xue |
| 2025 | DynoInfer: Adaptive Resource Orchestration for LLM Inference on Resource-Constrained PCs. | Yunling Chen, Qingyin Lin, Zhitao Chen, Yang Ou, Zhiguang Chen |