| 2026 | AAAI | FP=XINT: Representing Neural Networks via Low-Bit Series Basis Functions. | Boyang Zhang, Daning Cheng, Yunquan Zhang, Jiake Tian, Jing Li, Fangming Liu |
| 2026 | HPDC | A Fully GPU-Accelerated Framework for High-Performance Configuration Interaction Selection with Neural Network Quantum States. | Daran Sun, Bowen Kan, Haoquan Long, Hairui Zhao, Haoxu Li, Yicheng Liu, Pengyu Zhou, Ankang Feng, Wenjing Huang, Yida Gu, Zhenyu Li, Honghui Shang, Yunquan Zhang, Dingwen Tao, Ninghui Sun, Guangming Tan |
| 2026 | ICDCS | BCD-Megatron: A Cost-Effective Training System for Large Language Models. | Zeyu Liu, Yan Li, Yunquan Zhang, Boyang Zhang, Guoyong Jiang, Xin Zhang, Limin Xiao, Weifeng Zhang, Daning Cheng |
| 2026 | ICPR | Data Scaling Laws for Block-Sparse Training. | Zeyu Liu, Zhenfeng Zhang, Yunquan Zhang, Daning Cheng |
| 2025 | PPoPP | FlashFFTStencil: Bridging Fast Fourier Transforms to Memory-Efficient Stencil Computations on Tensor Core Units. | Haozhi Han, Kun Li, Wei Cui, Donglin Bai, Yiwei Zhang, Liang Yuan, Yifeng Chen, Yunquan Zhang, Ting Cao, Mao Yang |
| 2025 | PPoPP | Jigsaw: Toward Conflict-free Vectorized Stencil Computation by Tessellating Swizzled Registers. | Yiwei Zhang, Kun Li, Liang Yuan, Haozhi Han, Yunquan Zhang, Ting Cao, Mao Yang |
| 2025 | SC | Matrix Is All You Need: Rearchitecting Quantum Chemistry to Scale on AI Accelerators. | Haozhi Han, Kun Li, Fusong Ju, Qi Li, Hong An, Yifeng Chen, Yunquan Zhang, Ting Cao, Mao Yang |
| 2025 | SC | NNQS-SCI: Tackling Trillion-Dimensional Hilbert Space with Adaptive Neural Network Quantum States. | Bowen Kan, Yumeng Zhou, Daiyou Xie, Pengyu Zhou, Yunquan Zhang, Honghui Shang |
| 2025 | SC | SparStencil: Retargeting Sparse Tensor Cores to Scientific Stencil Computations via Structured Sparsity Transformation. | Qi Li, Kun Li, Haozhi Han, Liang Yuan, Yunquan Zhang, Yifeng Chen, Junshi Chen, Hong An, Ting Cao, Mao Yang |
| 2024 | HPDC | HAM-SpMSpV: an Optimized Parallel Algorithm for Masked Sparse Matrix-Sparse Vector Multiplications on multi-core CPUs. | Lei Xu, Haipeng Jia, Yunquan Zhang, Luhan Wang, Xianmeng Jiang |
| 2024 | ICS | Stencil Computation with Vector Outer Product. | Wenxuan Zhao, Liang Yuan, Baicheng Yan, Penghao Ma, Yunquan Zhang, Long Wang, Zhe Wang |
| 2024 | PPoPP | ConvStencil: Transform Stencil Computation to Matrix Multiplication on Tensor Cores. | Yuetao Chen, Kun Li, Yuhao Wang, Donglin Bai, Lei Wang, Lingxiao Ma, Liang Yuan, Yunquan Zhang, Ting Cao, Mao Yang |
| 2024 | SC | Pushing the Limit of Quantum Mechanical Simulation to the Raman Spectra of a Biological System with 100 Million Atoms. | Honghui Shang, Ying Liu, Zhikun Wu, Zhenchuan Chen, Jinfeng Liu, Meiyue Shao, Yingzhou Li, Bowen Kan, Huimin Cui, Xiaobing Feng, Yunquan Zhang, Donald G. Truhlar, Hong An, Xiao He, Jinlong Yang |
| 2024 | SC | LoRAStencil: Low-Rank Adaptation of Stencil Computation on Tensor Cores. | Yiwei Zhang, Kun Li, Liang Yuan, Jiawen Cheng, Yunquan Zhang, Ting Cao, Mao Yang |
| 2023 | ICPADS | SA_TRSM: A Shape-Aware Auto-Tuning Framework for Small-Scale Irregular-Shaped TRSM. | Rongyuan Guo, Haipeng Jia, Yunquan Zhang, Mingsen Deng, Cunyang Wei, Wenbin Chang, Xiang Zhao |
| 2023 | ICPADS | An Auto-Parallel Method for Deep Learning Models Based on Genetic Algorithm. | Yan Zeng, Chengchuang Huang, Yijie Ni, Chunbao Zhou, Jilin Zhang, Jue Wang, Mingyao Zhou, Meiting Xue, Yunquan Zhang |
| 2023 | ICS | OpenFFT: An Adaptive Tuning Framework for 3D FFT on ARM Multicore CPUs. | Tun Chen, Haipeng Jia, Yunquan Zhang, Kun Li, Zhihao Li, Xiang Zhao, Jianyu Yao, Chendi Li |
| 2023 | PPoPP | Generating Fast FFT Kernels on CPUs via FFT-Specific Intrinsics. | Zhihao Li, Haipeng Jia, Yunquan Zhang, Yuyan Sun, Yiwei Zhang, Tun Chen |
| 2022 | HPCC | EgpuIP: An Embedded GPU Accelerated Library for Image Processing. | Luhan Wang, Haipeng Jia, Yunquan Zhang, Kun Li, Cunyang Wei |
| 2022 | HPCC | LBBGEMM: A Load-balanced Batch GEMM Framework on ARM CPU s. | Cunyang Wei, Haipeng Jia, Yunquan Zhang, Kun Li, Luhan Wang |
| 2022 | HPCC | Aware: Adaptive Distributed Training with Computation, Communication and Position Awareness for Deep Learning Model. | Yan Zeng, Guangzheng Yi, Yuyu Yin, Jiyang Wu, Meiting Xue, Jilin Zhang, Jian Wan, Yunquan Zhang |
| 2022 | HPCC | Message from the High Performance Computing and Communications 2022 Program Chairs. | Yunquan Zhang, Jidong Zhai, Rajiv Ranjan |
| 2022 | ICPP | IATF: An Input-Aware Tuning Framework for Compact BLAS Based on ARMv8 CPUs. | Cunyang Wei, Haipeng Jia, Yunquan Zhang, Liusha Xu, Ji Qi |
| 2022 | SC | Large-Scale Simulation of Quantum Computational Chemistry on a New Sunway Supercomputer. | Honghui Shang, Li Shen, Yi Fan, Zhiqian Xu, Chu Guo, Jie Liu, Wenhao Zhou, Huan Ma, Rongfen Lin, Yuling Yang, Fang Li, Zhuoya Wang, Yunquan Zhang, Zhenyu Li |
| 2021 | HPCC | A Transpose-free Three-dimensional FFT Algorithm on ARM CPUs. | Tun Chen, Haipeng Jia, Zhihao Li, Chendi Li, Yunquan Zhang |
| 2021 | ICA3PP | AutoFlow: Hotspot-Aware, Dynamic Load Balancing for Distributed Stream Processing. | Pengqi Lu, Yue Yue, Liang Yuan, Yunquan Zhang |
| 2021 | ICPADS | IAAT: A Input-Aware Adaptive Tuning framework for Small GEMM. | Jianyu Yao, Boqian Shi, Chunyang Xiang, Haipeng Jia, Chendi Li, Hang Cao, Yunquan Zhang |
| 2021 | ISPA | AutoTSMM: An Auto-tuning Framework for Building High-Performance Tall-and-Skinny Matrix-Matrix Multiplication on CPUs. | Chendi Li, Haipeng Jia, Hang Cao, Jianyu Yao, Boqian Shi, Chunyang Xiang, Jinbo Sun, Pengqi Lu, Yunquan Zhang |
| 2021 | SC | Reducing redundancy in data organization and arithmetic calculation for stencil computations. | Kun Li, Liang Yuan, Yunquan Zhang, Yue Yue |
| 2021 | SC | TensorKMC: kinetic Monte Carlo simulation of 50 trillion atoms driven by deep learning on a new generation of Sunway supercomputer. | Honghui Shang, Xin Chen, Xingyu Gao, Rongfen Lin, Lifang Wang, Fang Li, Qian Xiao, Lei Xu, Qiang Sun, Leilei Zhu, Fei Wang, Yunquan Zhang, Haifeng Song |
| 2021 | SC | Accelerating all-electron | Honghui Shang, Fang Li, Yunquan Zhang, Ying Liu, Libo Zhang, Mingchuan Wu, Yangjun Wu, Di Wei, Huimin Cui, Xin Liu, Fei Wang, Yuxi Ye, Yingxiang Gao, Shuang Ni, Xin Chen, Dexun Chen |
| 2021 | SC | Extreme-scale | Honghui Shang, Fang Li, Yunquan Zhang, Libo Zhang, You Fu, Yingxiang Gao, Yangjun Wu, Xiaohui Duan, Rongfen Lin, Xin Liu, Ying Liu, Dexun Chen |
| 2021 | SC | Temporal vectorization for stencils. | Liang Yuan, Hang Cao, Yunquan Zhang, Kun Li, Pengqi Lu, Yue Yue |
| 2020 | ICA3PP | Performance Optimization for Feature Extraction Section of DeepChem. | Ke Zhan, Zhonghua Lu, Yunquan Zhang |
| 2019 | ICPP | Tessellating Star Stencils. | Liang Yuan, Shan Huang, Yunquan Zhang, Hang Cao |
| 2019 | ICTAI | Using Gradient Based Multikernel Gaussian Process and Meta-Acquisition Function to Accelerate SMBO. | Daning Cheng, Hanping Zhang, Fen Xia, Shigang Li, Yunquan Zhang |
| 2019 | ISPA | swMD: Performance Optimizations for Molecular Dynamics Simulation on Sunway Taihulight. | Kun Li, Shigang Li, Bei Wang, Yifeng Chen, Yunquan Zhang |
| 2019 | SC | AutoFFT: a template-based FFT codes auto-generation framework for ARM and X86 CPUs. | Zhihao Li, Haipeng Jia, Yunquan Zhang, Tun Chen, Liang Yuan, Luning Cao, Xiao Wang |
| 2019 | SC | OpenKMC: a KMC design for hundred-billion-atom simulation using millions of cores on Sunway Taihulight. | Kun Li, Honghui Shang, Yunquan Zhang, Shigang Li, Baodong Wu, Dong Wang, Libo Zhang, Fang Li, Dexun Chen, Zhiqiang Wei |
| 2018 | ICA3PP | Implementation and Optimization of Multi-dimensional Real FFT on ARMv8 Platform. | Xiao Wang, Haipeng Jia, Zhihao Li, Yunquan Zhang |
| 2018 | ICPADS | AGCM3D: A Highly Scalable Finite-Difference Dynamical Core of Atmospheric General Circulation Model Based on 3D Decomposition. | Baodong Wu, Shigang Li, Hang Cao, Yunquan Zhang, He Zhang, Junmin Xiao, Minghua Zhang |
| 2018 | ICPP | Massively Scaling the Metal Microscopic Damage Simulation on Sunway TaihuLight Supercomputer. | Shigang Li, Baodong Wu, Yunquan Zhang, Xianmeng Wang, Jianjiang Li, Changjun Hu, Jue Wang, Yangde Feng, Ningming Nie |
| 2018 | ICPP | Communication-Avoiding for Dynamical Core of Atmospheric General Circulation Model. | Junmin Xiao, Shigang Li, Baodong Wu, He Zhang, Kun Li, Erlin Yao, Yunquan Zhang, Guangming Tan |
| 2018 | PAKDD | Rolling Forecasting Forward by Boosting Heterogeneous Kernels. | Di Zhang, Yunquan Zhang, Qiang Niu, Xingbao Qiu |
| 2017 | ICPADS | HartSift: A High-Accuracy and Real-Time SIFT Based on GPU. | Zhihao Li, Haipeng Jia, Yunquan Zhang |
| 2017 | PPoPP | POSTER: Cache-Oblivious MPI All-to-All Communications on Many-Core Architectures. | Shigang Li, Yunquan Zhang, Torsten Hoefler |
| 2017 | SC | Tessellating stencils. | Liang Yuan, Yunquan Zhang, Peng Guo, Shan Huang |
| 2016 | NPC | Efficient Management for Hybrid Memory in Managed Language Runtime. | Chenxi Wang, Ting Cao, John N. Zigman, Fang Lv, Yunquan Zhang, Xiaobing Feng |
| 2015 | CCGRID | Parallel Solving Method of SOR Based on the Numerical Marine Forecasting Model. | Renbo Pang, Jianliang Xu, Yunquan Zhang |
| 2015 | CCGRID | Analyzing MPI-3.0 Process-Level Shared Memory: A Case Study with Stencil Computations. | Xiaomin Zhu, Junchao Zhang, Kazutomo Yoshii, Shigang Li, Yunquan Zhang, Pavan Balaji |
| 2015 | HPCC | Optimized Password Recovery for Encrypted RAR on GPUs. | Xiaojing An, Haipeng Jia, Yunquan Zhang |
| 2015 | HPCC | Fast Convolution Operations on Many-Core Architectures. | Shigang Li, Yunquan Zhang, Chunyang Xiang, Lei Shi |
| 2015 | ICPP | Optimizing Image Sharpening Algorithm on GPU. | Mengran Fan, Haipeng Jia, Yunquan Zhang, Xiaojing An, Ting Cao |
| 2014 | HPCC | Research on Mahalanobis Distance Algorithm Optimization Based on OpenCL. | Qingchun Xie, Yunquan Zhang, Haipeng Jia, Yongquan Lu |
| 2014 | ICPADS | Physically based parallel ray tracer for the Metropolis light transport algorithm on the Tianhe-2 supercomputer. | Changmao Wu, Yunquan Zhang, Congli Yang, Yutong Lu |
| 2014 | PPoPP | yaSpMV: yet another SpMV framework on GPUs. | Shengen Yan, Chao Li, Yunquan Zhang, Huiyang Zhou |
| 2013 | HPCC | CLSIFT: An Optimization Study of the Scale Invariance Feature Transform on GPUs. | Weiyan Wang, Yunquan Zhang, Guoping Long, Shengen Yan, Haipeng Jia |
| 2013 | HPCC | Large Scale Satellite Imagery Simulations with Physically Based Ray Tracing on Tianhe-1A Supercomputer. | Changmao Wu, Yunquan Zhang, Congli Yang |
| 2013 | ICA3PP | H-DB: Yet Another Big Data Hybrid System of Hadoop and DBMS. | Tao Luo, Guoliang Chen, Yunquan Zhang |
| 2013 | ICDCS | pVOCL: Power-Aware Dynamic Placement and Migration in Virtualized GPU Environments. | Palden Lama, Yan Li, Ashwin M. Aji, Pavan Balaji, James Dinan, Shucai Xiao, Yunquan Zhang, Wu-chun Feng, Rajeev Thakur, Xiaobo Zhou |
| 2013 | PPoPP | StreamScan: fast scan algorithms for GPUs without global barrier synchronization. | Shengen Yan, Guoping Long, Yunquan Zhang |
| 2013 | SC | AUGEM: automatically generate high performance dense linear algebra kernels on x86 CPUs. | Qian Wang, Xianyi Zhang, Yunquan Zhang, Qing Yi |
| 2012 | CLUSTER | A Locality-based Performance Model for Load-and-Compute Style Computation. | Liang Yuan, Yunquan Zhang |
| 2012 | EuroPar | GPURoofline: A Model for Guiding Performance Optimizations on GPUs. | Haipeng Jia, Yunquan Zhang, Guoping Long, Jianliang Xu, Shengen Yan, Yan Li |
| 2012 | HPCC | Accelerating Viola-Jones Facce Detection Algorithm on GPUs. | Haipeng Jia, Yunquan Zhang, Weiyan Wang, Jianliang Xu |
| 2012 | ICA3PP | An Insightful Program Performance Tuning Chain for GPU Computing. | Haipeng Jia, Yunquan Zhang, Guoping Long, Shengen Yan |
| 2012 | ICPADS | Model-driven Level 3 BLAS Performance Optimization on Loongson 3A Processor. | Xianyi Zhang, Qian Wang, Yunquan Zhang |
| 2012 | ICPP | Modeling the Locality in Graph Traversals. | Liang Yuan, Chen Ding, Daniel Stefankovic, Yunquan Zhang |
| 2011 | EuroPar | CRSD: Application Specific Auto-tuning of SpMV for Diagonal Sparse Matrices. | Xiangzheng Sun, Yunquan Zhang, Ting Wang, Guoping Long, Xianyi Zhang, Yan Li |
| 2011 | ICPADS | Automatic FFT Performance Tuning on OpenCL GPUs. | Yan Li, Yunquan Zhang, Haipeng Jia, Guoping Long, Ke Wang |
| 2011 | ICPP | Optimizing SpMV for Diagonal Sparse Matrices on GPU. | Xiangzheng Sun, Yunquan Zhang, Ting Wang, Xianyi Zhang, Liang Yuan, Li Rao |
| 2010 | HPCC | Numerical Simulation of the Thermal Convection in the Earth's Outer Core. | Chao Yang, Yunquan Zhang, Ligang Li |
| 2010 | HPCC | Optimizing Sparse Matrix Vector Multiplication Using Diagonal Storage Matrix Format. | Liang Yuan, Yunquan Zhang, Xiangzheng Sun, Ting Wang |
| 2009 | HPCC | Performance Evaluation of Multithreaded Sparse Matrix-Vector Multiplication Using OpenMP. | Shengfei Liu, Yunquan Zhang, Xiangzheng Sun, RongRong Qiu |
| 2009 | HPCC | QuantWiz: A Parallel Software Package for LC-MS-based Label-Free Protein Quantification. | Jing Wang, Yunquan Zhang, Xianyi Zhang, Xiangzheng Sun, Zelin Hu, Sujun Li, Rong Zeng |
| 2009 | ICPADS | Early Performance Evaluation of Dawning 5000A and DeepComp 7000. | Yuan Yu, Yunquan Zhang, Ting Wang, Jiachang Sun, Xianyi Zhang, Yuxin Tang, Li Rao |
| 2008 | HPCC | Utilizing the Multi-threading Techniques to Improve the Two-Level Checkpoint/Rollback System for MPI Applications. | Yuan Tang, Yunquan Zhang |
| 2008 | HPCC | A Parallel Shortest Path Algorithm Based on Graph-Partitioning and Iterative Correcting. | Yuxin Tang, Yunquan Zhang, Hu Chen |
| 2008 | HPCC | Memory Access Complexity Analysis of SpMV in RAM (h) Model. | E. Yuan, Yunquan Zhang, Xiangzheng Sun |
| 2008 | HPCC | Parallelization of FM-Index. | Di Zhang, Yunquan Zhang, Shengfei Liu, Xiaodi Huang |
| 2007 | ECIR | Efficient Construction of FM-index Using Overlapping Block Processing for Large Scale Texts. | Di Zhang, Yunquan Zhang, Jing Chen |
| 2007 | SC | Block size selection of parallel LU and QR on PVP-based and RISC-based supercomputers. | Yunquan Zhang, Ying Chen, Yuan Tang |
| 2007 | SC | A brief introduction to China HPC TOP100: from 2002 to 2006. | Yunquan Zhang, Jiachang Sun, Guoxing Yuan, Linbo Zhang |