| 2025 | An RDMA-First Object Storage System with SmartNIC Offload. | Yu Zhu, Aditya Dhakal, Pedro Bruel, Gourav Rattihalli, Yunming Xiao, Johann Lombardi, Dejan S. Milojicic |
| 2025 | Make Updates Faster: A Fast Multi-Stripe Updates Framework in Erasure-Coded Storage Clusters. | Hai Zhou, Dan Feng |
| 2025 | Enabling Unstructured Sparse Fine-Tuning and Inference for Foundation Models on Wafer-Scale Engine. | Haoyu Zheng, Yifan Zeng, Linghao Song, Murali Emani, Wenqian Dong |
| 2025 | Minimizing Power Waste in Heterogenous Computing via Adaptive Uncore Scaling. | Zhong Zheng, Seyfal Sultanov, Michael E. Papka, Zhiling Lan |
| 2025 | Secure In-Storage Execution of VTK Workloads on Modern Parallel NFS Data Servers. | Qing Zheng, Brian Atkinson, Jason Lee, Daoce Wang, Gary Grider |
| 2025 | RedSan: A Redundant Memory Instruction Sanitizer for GPU Programs. | Yanbo Zhao, Yueming Hao, Zecheng Li, Shuyin Jiao, Xu Liu, Jiajia Li |
| 2025 | QDockBank: A dataset for Ligand Docking on Protein Fragments Predicted on Utility-Level Quantum Computers. | Yuqi Zhang, Yuxin Yang, Cheng-Chang Lu, Weiwen Jiang, Feixiong Cheng, Bo Fang, Qiang Guan |
| 2025 | KDRSolvers: Scalable, Flexible, Task-Oriented Krylov Solvers. | David Kai Zhang, Rohan Yadav, Alex Aiken, Fredrik Kjolstad, Sean Treichler |
| 2025 | HyTiS: Hybrid Tile Scheduling for GPU GEMM with Enhanced Wave Utilization and Cache Locality. | Zheng Zhang, Hulin Wang, Hongming Xu, Donglin Yang, Xiaobo Zhou, Dazhao Cheng |
| 2025 | BOER: Enhancing Resource Utilization for Deep Learning Inference with Hybrid Spatial GPU Sharing. | Bowen Zhang, Yuhang Wang, Zhuozhao Li |
| 2025 | Advancing Quantum Many-Body GW Calculations on Exascale Supercomputing Platforms. | Benran Zhang, Daniel Weinberg, Chih-En Hsu, Aaron R. Altman, Yuming Shi, James B. White, Derek Vigil-Fowler, Steven G. Louie, Jack R. Deslippe, Felipe H. da Jornada, Zhenglu Li, Mauro Del Ben |
| 2025 | High-Performance Branch-Free Algorithms for Extended-Precision Floating-Point Arithmetic. | David Kai Zhang, Alex Aiken |
| 2025 | InferCT: An Efficient and Generalizable Framework to Enable 3D Machine Learning for Computed Tomography. | Austin Yunker, Weijian Zheng, Rajkumar Kettimuthu |
| 2025 | MetoHash: A Memory-Efficient and Traffic-Optimized Hashing Index on Hybrid PMem-DRAM Memories. | Zixiang Yu, Guangyang Deng, Zhirong Shen, Qiangsheng Su, Ronglong Wu, Xiaoli Wang, Quanqing Xu, Chuanhui Yang, Zhifeng Bao |
| 2025 | DAS-ILU: A Distributed Asynchronous Parallel ILU Factorization Based on Domain Decomposition. | Fan Yuan, Shengguo Li, Xiaojian Yang, Yunqing Huang, Hongxia Wang, Chuanfu Xu, Dezun Dong, Tiejun Li, Jianchun Wang, Jie Liu |
| 2025 | X-MoE: Enabling Scalable Training for Emerging Mixture-of-Experts Architectures on HPC Platforms. | Yueming Yuan, Ahan Gupta, Jianping Li, Sajal Dash, Feiyi Wang, Minjia Zhang |
| 2025 | TaGNN: An Efficient Topology-aware Accelerator for High-performance Dynamic Graph Neural Network. | Hui Yu, Yu Zhang, Ligang He, Bing Peng, Jin Zhao, Zixiao Wang, Hao Qi, Hai Jin |
| 2025 | RingX: Scalable Parallel Attention for Long-Context Learning on HPC. | Junqi Yin, Mijanur Palash, Mallikarjun Shankar, Feiyi Wang |
| 2025 | Do Large Language Models Speak Scientific Workflows? | Orcun Yildiz, Tom Peterka |
| 2025 | Classification of Three-dimensional Electron Diffraction Data with a Large Language Model. | Kazuyuki Yasuda, Masahito Kumagai, Masayuki Sato, Kazuhiko Komatsu, Hiroaki Kobayashi |
| 2025 | LowDiff: Efficient Frequent Checkpointing via Low-Cost Differential for High-Performance Distributed Training Systems. | Chenxuan Yao, Feifan Liu, Yuchong Hu, Zhengyu Liu, Xinjue Zheng, Wenxiang Zhou |
| 2025 | LCI: a Lightweight Communication Interface for Efficient Asynchronous Multithreaded Communication. | Jiakun Yan, Marc Snir |
| 2025 | Phoenix: A Refactored I/O Stack for GPU Direct Storage without Phony Buffers. | Jianqin Yan, Shi Qiu, Yina Lv, Yifan Hu, Hao Chen, Zhirong Shen, Xin Yao, Renhai Chen, Jiwu Shu, Gong Zhang, Yiming Zhang |
| 2025 | AGILE: Lightweight and Efficient Asynchronous GPU-SSD Integration. | Zhuoping Yang, Jinming Zhuang, Xingzhen Chen, Alex K. Jones, Peipei Zhou |
| 2025 | UltraAttn: Efficiently Parallelizing Attention through Hierarchical Context-Tiling. | Haoyu Yang, Zan Zong, Yuyang Jin, Kinman Lei, Jiaao He, Qigang Yang, Jidong Zhai |