| 2026 | DATE | CISim: ISA-Agnostic Custom Instruction Simulation for General-Purpose Processor. | Xiaoyu Hao, Sen Zhang, Liang Qiao, Jun Shi, Junshi Chen, Hong An |
| 2026 | EuroPar | AtSpMV: Model-Guided Adaptive Tiling and Load Balancing for SpMV on GPUs. | Jiajun Cheng, Junshi Chen, Qi Li, Longsheng Song, Yang Zhao, Jun Shi, Xiaoyu Hao, Hong An |
| 2025 | ASPLOS | Pruner: A Draft-then-Verify Exploration Mechanism to Accelerate Tensor Program Tuning. | Liang Qiao, Jun Shi, Xiaoyu Hao, Xi Fang, Sen Zhang, Minfan Zhao, Ziqi Zhu, Junshi Chen, Hong An, Xulong Tang, Bing Li, Honghui Yuan, Xinyang Wang |
| 2025 | DAC | NDFT: Accelerating Density Functional Theory Calculations via Hardware/Software Co-Design on Near-Data Computing System. | Qingcai Jiang, Buxin Tu, Xiaoyu Hao, Junshi Chen, Hong An |
| 2025 | DATE | NDPage: Efficient Address Translation for Near-Data Processing Architectures via Tailored Page Table. | Qingcai Jiang, Buxin Tu, Hong An |
| 2025 | EuroPar | Uniform Dense Blocking for Efficient Sparse LU Factorization in First-Principles Materials Simulation. | Chao Wang, Junshi Chen, Longsheng Song, Haijie Hou, Dongdong Tan, Yueqiang He, Wentiao Wu, Sihan Lu, Hong An |
| 2025 | ICA3PP | HManyCore-Sim: Heterogeneous Simulator for Deeply Fused Many-Core Processor. | Liyi Wang, Hong An, Xiahui Hu, Yingying Wu, Yiyun Yin, Qinglin Liu, Hongyu Zhang |
| 2025 | ICASSP | Carver: Learning to Reconstruct Right Ventricle from Sparse Multi-View 2D Echocardiograms. | Yida Li, Jun Shi, Zhaohui Wang, Tiantong Wang, Ziqi Zhu, Minfan Zhao, Junshi Chen, Hong An |
| 2025 | ICASSP | PromptSeg: Learning to Segment Medical Image via Visual Prompts. | Minfan Zhao, Ziqi Zhu, Jun Shi, Zhaohui Wang, Junshi Chen, Hong An, Bing Yan |
| 2025 | ISCA | AMALI: An Analytical Model for Accurately Modeling LLM Inference on Modern GPUs. | Shiheng Cao, Junmin Wu, Junshi Chen, Hong An, Zhibin Yu |
| 2025 | ICS | CIExplorer: Microarchitecture-Aware Exploration for Tightly Integrated Custom Instruction. | Xiaoyu Hao, Sen Zhang, Liang Qiao, Qingcai Jiang, Jun Shi, Junshi Chen, Hong An, Xulong Tang, Hao Shu, Honghui Yuan |
| 2025 | SC | Million-Atom Ab Initio Electron Dynamics: Discontinuous Galerkin Real-Time Time-Dependent Density Functional Theory. | Junwei Feng, Junshi Chen, Xiangyu Zhang, Junhui Liu, Xinming Qin, Lingyun Wan, Sheng Chen, Wentiao Wu, Bingkun Hou, Yexuan Lin, Yihong Zhang, Zechuan Zhang, Yijun Hu, Weile Jia, Hong An, Jinlong Yang, Wei Hu |
| 2025 | SC | Matrix Is All You Need: Rearchitecting Quantum Chemistry to Scale on AI Accelerators. | Haozhi Han, Kun Li, Fusong Ju, Qi Li, Hong An, Yifeng Chen, Yunquan Zhang, Ting Cao, Mao Yang |
| 2025 | SC | SparStencil: Retargeting Sparse Tensor Cores to Scientific Stencil Computations via Structured Sparsity Transformation. | Qi Li, Kun Li, Haozhi Han, Liang Yuan, Yunquan Zhang, Yifeng Chen, Junshi Chen, Hong An, Ting Cao, Mao Yang |
| 2024 | DATE | A | Qingcai Jiang, Shaojie Tan, Junshi Chen, Hong An |
| 2024 | HPCC | swYAKL: A Data Parallel Runtime on Manycore Architecture. | Yanwei Ye, Junshi Chen, Hong Qian, Kunxian Lin, Yuanhang Li, Hong An |
| 2024 | ICPP | Multi-level Load Balancing Strategies for Massively Parallel Smoothed Particle Hydrodynamics Simulation. | Yi Zhang, Ziyu Zhang, Yang Zhao, Junshi Chen, Hong An, Zhanming Wang, Longkui Chen |
| 2024 | ICPP | DB-SpGEMM: A Massively Distributed Block-Sparse Matrix-Matrix Multiplication for Linear-Scaling DFT Calculations. | Zhong Zheng, Junshi Chen, Yang Zhao, Longsheng Song, Xinming Qin, Hong An |
| 2024 | IJCAI | Predictive Accuracy-Based Active Learning for Medical Image Segmentation. | Jun Shi, Shulan Ruan, Ziqi Zhu, Minfan Zhao, Hong An, Xudong Xue, Bing Yan |
| 2024 | SC | Pushing the Limit of Quantum Mechanical Simulation to the Raman Spectra of a Biological System with 100 Million Atoms. | Honghui Shang, Ying Liu, Zhikun Wu, Zhenchuan Chen, Jinfeng Liu, Meiyue Shao, Yingzhou Li, Bowen Kan, Huimin Cui, Xiaobing Feng, Yunquan Zhang, Donald G. Truhlar, Hong An, Xiao He, Jinlong Yang |
| 2024 | SC | Enabling 13K-Atom Excited-State GW Calculations via Low-Rank Approximations and HPC on the New Sunway Supercomputer. | Wentiao Wu, Zhengbang Zhou, Qingcai Jiang, Junwei Feng, Xinming Qin, Huanhuan Ma, Zhenwei Cao, Junshi Chen, Sheng Chen, Xinyong Meng, Bingkun Hou, Yuanfan Xiong, Linhao Wang, Yixuan Sun, Hong An, Jinlong Yang, Wei Hu |
| 2023 | EuroPar | SWSPH: A Massively Parallel SPH Implementation for Hundred-Billion-Particle Simulation on New Sunway Supercomputer. | Ziyu Zhang, Junshi Chen, Zhanming Wang, Yifan Luo, Jineng Yao, Shenghong Huang, Hong An |
| 2023 | MICCAI | H-DenseFormer: An Efficient Hybrid Densely Connected Transformer for Multimodal Tumor Segmentation. | Jun Shi, Hongyu Kan, Shulan Ruan, Ziqi Zhu, Minfan Zhao, Liang Qiao, Zhaohui Wang, Hong An, Xudong Xue |
| 2023 | MICCAI | Contrast Learning Based Robust Framework for Weakly Supervised Medical Image Segmentation with Coarse Bounding Box Annotations. | Ziqi Zhu, Jun Shi, Minfan Zhao, Zhaohui Wang, Liang Qiao, Hong An |
| 2023 | SC | Establishing a Modeling System in 3-km Horizontal Resolution for Global Atmospheric Circulation triggered by Submarine Volcanic Eruptions with 400 Billion Smoothed Particle Hydrodynamics. | Shenghong Huang, Junshi Chen, Ziyu Zhang, Xiaoyu Hao, Jun Gu, Hong An, Chun Zhao, Yan Hu, Zhanming Wang, Longkui Chen, Yifan Luo, Jineng Yao, Yi Zhang, Yang Zhao, Zhihao Wang, Dongning Jia, Zhao Jin, Changming Song, Xisheng Luo, Xiaobin He, Dexun Chen |
| 2022 | HPCC | Quantifying Throughput of Basic Blocks on ARM Microarchitectures by Static Code Analyzers: A Case Study on Kunpeng 920. | Qingcai Jiang, Shaojie Tan, Zhenwei Cao, Xiaoyu Hao, Junshi Chen, Hong An |
| 2022 | HPCC | Machine Learning-enabled Performance Model for DNN Applications and AI Accelerator. | Ruohan Wu, Mingfan Li, Hanxi Li, Tianxiang Chen, Xinghui Tian, Xiaoxin Xu, Bin Zhou, Junshi Chen, Hong An |
| 2022 | HPCC | High-Performance Matrix Multiplication on the New Generation Shenwei Processor. | Le Xu, Hong An, Junshi Chen, Pengfei Zhang |
| 2022 | ICPP | Accelerating Parallel First-Principles Excited-State Calculation by Low-Rank Approximation with K-Means Clustering. | Qingcai Jiang, Jielan Li, Junshi Chen, Xinming Qin, Lingyun Wan, Jinlong Yang, Jie Liu, Wei Hu, Hong An |
| 2022 | SC | 2.5 Million-Atom Ab Initio Electronic-Structure Simulation of Complex Metallic Heterostructures with DGDFT. | Wei Hu, Hong An, Zhuoqiang Guo, Qingcai Jiang, Xinming Qin, Junshi Chen, Weile Jia, Chao Yang, Zhaolong Luo, Jielan Li, Wentiao Wu, Guangming Tan, Dongning Jia, Qinglin Lu, Fangfang Liu, Min Tian, Fang Li, Yeqi Huang, Liyi Wang, Sha Liu, Jinlong Yang |
| 2022 | SC | AI for Quantum Mechanics: High Performance Quantum Many-Body Simulations via Deep Learning. | Xuncheng Zhao, Mingfan Li, Qian Xiao, Junshi Chen, Fei Wang, Li Shen, Meijia Zhao, Wenhao Wu, Hong An, Lixin He, Xiao Liang |
| 2021 | SC | Symplectic structure-preserving particle-in-cell whole-volume simulation of tokamak plasmas to 111.3 trillion particles and 25.7 billion grids. | Jianyuan Xiao, Junshi Chen, Jiangshan Zheng, Hong An, Shenghong Huang, Chao Yang, Fang Li, Ziyu Zhang, Yeqi Huang, Wenting Han, Xin Liu, Dexun Chen, Zixi Liu, Ge Zhuang, Jiale Chen, Guoqiang Li, Xuan Sun, Qiang Chen |
| 2020 | HPCC | Optimizing Astrophysical Simulation Software on Sunway Heterogeneous Manycore Architecture. | Tao Fang, Junshi Chen, Mingfan Li, Ziyu Zhang, Hong An, Wenting Han |
| 2020 | HPCC | An Efficient Multi-GPU Implementation for Linear-Response Time-Dependent Density Functional Theory. | Qingcai Jiang, Lingyun Wan, Shizhe Jiao, Wei Hu, Junshi Chen, Hong An |
| 2020 | NPC | RDMA-Based Apache Storm for High-Performance Stream Data Processing. | Ziyu Zhang, Zitan Liu, Qingcai Jiang, Zheng Wu, Junshi Chen, Hong An |
| 2019 | HPCC | Redesign NAMD Molecular Dynamics Non-Bonded Force-Field on Sunway Manycore Processor. | Junshi Chen, Hong An, Binghui Yan, Weihao Liang, Xin Liu |
| 2019 | HPCC | Interference-Aware I/O Scheduling for Data-Intensive Applications on Hierarchical HPC Storage Systems. | Weihao Liang, Yong Chen, Hong An |
| 2019 | HPCC | TripletRun: A Dataflow Runtime Simulator and Its Performance Model. | Han Lin, Hong An, Mingfan Li, Zeng Lin, Junshi Chen, Wenting Han |
| 2019 | HPCC | swFLOW: A Dataflow Deep Learning Framework on Sunway TaihuLight Supercomputer. | Han Lin, Zeng Lin, Jose Monsalve Diaz, Mingfan Li, Hong An, Guang R. Gao |
| 2019 | HPCC | Improving the Performance of MongoDB with RDMA. | Fan Lu, Tao Fang, Ziyu Zhang, Sen Li, Junshi Chen, Hong An, Wenting Han |
| 2019 | ISPA | Gdarts: A GPU-Based Runtime System for Dataflow Task Programming on Dependency Applications. | Mingfan Li, Qingcai Jiang, Han Lin, Hong An |
| 2019 | NPC | DDP-B: A Distributed Dynamic Parallel Framework for Meta-genomics Binary Similarity. | Mengxian Chi, Xu Jin, Feng Li, Hong An |
| 2017 | ICA3PP | Pipelining Computation and Optimization Strategies for Scaling GROMACS on the Sunway Many-Core Processor. | Yang Yu, Hong An, Junshi Chen, Weihao Liang, Qingqing Xu, Yong Chen |
| 2017 | ISPA | Refactoring the Molecular Docking Simulation for Heterogeneous, Manycore Processors Systems. | Junshi Chen, Han Lin, Weihao Liang, Yang Yu, Wenting Han, Hong An, Yong Chen, Xin Liu |
| 2017 | ISPA | A Dataflow-Based Runtime Support on a 100P Actual System. | Zhichao Su, Junshi Chen, Han Lin, Hong An, Wenting Han, Yang Yu, Chenzhi Liao, Yong Chen |
| 2016 | ICPADS | Parallelizing Back Propagation Neural Network on Speculative Multicores. | Yaobin Wang, Hong An, Zhiqin Liu, Tao Liu, Dongmei Zhao |
| 2016 | TrustCom | A Flexible Chip Multiprocessor Simulator Dedicated for Thread Level Speculation. | Yaobin Wang, Hong An, Zhiqin Liu, Ling Li, Jun Huang |
| 2015 | ICA3PP | Optimization of Binomial Option Pricing on Intel MIC Heterogeneous System. | Weihao Liang, Hong An, Feng Li, Yichao Cheng |
| 2015 | ICA3PP | Parallelizing Block Cryptography Algorithms on Speculative Multicores. | Yaobin Wang, Hong An, Zhiqin Liu, Lei Zhang, Qingfeng Wang |
| 2015 | ICA3PP | Local State Reusing for Efficient Model Checking of Multithreaded Programs. | Junrui Zhou, Hong An, Yunyun Wang, Junshi Chen |
| 2015 | ICONIP | Optimization and Analysis of Parallel Back Propagation Neural Network on GPU Using CUDA. | Yaobin Wang, Pingping Tang, Hong An, Zhiqin Liu, Kun Wang, Yong Zhou |
| 2014 | HPCC | A Compiler Translate Directive-Based Language to Optimized CUDA. | Feng Li, Hong An, Weihao Liang, Xiaoqiang Li, Yichao Cheng, Xia Jiang |
| 2014 | ICA3PP | Understanding the SIMD Efficiency of Graph Traversal on GPU. | Yichao Cheng, Hong An, Zhitao Chen, Feng Li, Zhaohui Wang, Xia Jiang, Yi Peng |
| 2013 | TrustCom | Quantitative Analysis of Inter-block Dependence in Speculative Execution. | Junrui Zhou, Hong An, Yanyan Zou, Tao Sun |
| 2012 | HPCC | VSCP: A Cache Controlling Method for Improving Single Thread Performance in Multicore System. | Yu Liu, Hong An, Xiaomei Li, Peng Leng, Sun Sun, Junshi Chen |
| 2012 | ICPADS | SeTM: Efficient Execution of Speculative Threads with Hardware Transactional Memory. | Gongming Li, Hong An, Qi Li, Bobin Deng, Wenbo Dai |
| 2012 | ICS | Distributed replay protocol for distributed uniprocessors. | Mengjie Mao, Hong An, Bobin Deng, Tao Sun, Xuechao Wei, Wei Zhou, Wenting Han |
| 2012 | ICS | CRQ-based fair scheduling on composable multicore architectures. | Tao Sun, Hong An, Tao Wang, Haibo Zhang, Xiufeng Sui |
| 2012 | PPoPP | FlexBFS: a parallelism-aware implementation of breadth-first search on GPU. | Gu Liu, Hong An, Wenting Han, Xiaoqiang Li, Tao Sun, Wei Zhou, Xuechao Wei, Xulong Tang |
| 2011 | CIS | Accelerating Block Cryptography Algorithms in Procedure Level Speculation. | Yaobin Wang, Hong An, Zhiqin Liu, Kang Xu, Wanli Dong |
| 2011 | ISPA | A Priority-Aware NoC to Reduce Squashes in Thread Level Speculation for Chip Multiprocessors. | Wenbo Dai, Hong An, Qi Li, Gongming Li, Bobin Deng, Shilei Wu, Xiaomei Li, Yu Liu |
| 2011 | ISPA | A Non-blocking Programming Framework for Pipeline Application on Multi-core Platform. | Xiaoqiang Li, Hong An, Gu Liu, Wenting Han, Mu Xu, Wei Zhou, Qi Li |
| 2011 | PDCAT | CHMasters: A Scalable and Speed-Efficient Metadata Service in Distributed File System. | Min Xu, Junrui Zhou, Wei Zhou, Hong An |
| 2010 | ICA3PP | Dynamic Resource Tuning for Flexible Core Chip Multiprocessors. | Yongqing Ren, Hong An, Tao Sun, Ming Cong, Yaobin Wang |
| 2010 | ICCSA | Pattern-Unit Based Regular Expression Matching with Reconfigurable Function Unit. | Ming Cong, Hong An, Lu Cao, Yuan Liu, Peng Li, Tao Wang, Zhihong Yu, Dong Liu |
| 2010 | PDCAT | FACRA: Flexible-Core Architecture Chip Resource Abstractor. | Tao Sun, Hong An, Yongqing Ren, Mengjie Mao, Yang Liu, Mu Xu, Qi Li |
| 2009 | PDCAT | The Mapping Framework and Optimizing Strategy for Block Cryptography Algorithms on Cell Broadband Engine. | Mu Xu, Hong An, Gu Liu, Yaobin Wang, Guang Xu, Ping Yao, Xiurui Hao, Wenting Han |
| 2000 | SAC | Broadcasting Under Network Ignorance Scenario. | Xiangchuan Chen, Hong An, Shirong Zheng |