| 2025 | ICA3PP | A Parallel Implementation of ChaCha20 on MT-3000 Heterogeneous Multi-zone Processor. | Yongtao Luo, Jie Liu, Tun Li, Chunye Gong |
| 2025 | ICA3PP | AccuGraph: Memory-Efficient Full-Graph GNN Training on a Single GPU via Subgraph Accumulation. | Liyang Wu, Menghan Jia, Lizhi Zhang, Yahui Wu, Gongqingjian Jiang, Jiezhong He, Chunye Gong, Yinghui Gao |
| 2025 | IJCNN | Informative Discrimination Network for Efficient Single Image Super-Resolution. | Yuzheng Tu, Xinhai Chen, Chunye Gong, Jie Liu, Bo Yang, Xiang Gao, Xiang Zhang |
| 2025 | ICS | YH-Light: Yielding Hierarchy-aware Partitioner for Large-scale Graph Processing. | Xinbiao Gan, Tiejun Li, Chunye Gong, Jie Liu, Kai Lu |
| 2025 | WWW | GraphCSR: A Space and Time-Efficient Sparse Matrix Representation for Web-scale Graph Processing. | Xinbiao Gan, Tiejun Li, Qiang Zhang, Guang Wu, Bo Yang, Chunye Gong, Jie Liu, Kai Lu |
| 2025 | SC | TianheEngine: Hierarchy-aware Adaptive Partitioning System for Trillion-scale Graph Processing. | Xinbiao Gan, Tiejun Li, Yiqi Wang, Qiang Zhang, Yongming Yi, Chunye Gong, Jie Liu, Kai Lu |
| 2024 | ICA3PP | A Hybrid Vectorized Merge Sort on ARM NEON. | Jincheng Zhou, Jin Zhang, Xiang Zhang, Tiaojie Xiao, Di Ma, Chunye Gong |
| 2024 | PPoPP | GraphCube: Interconnection Hierarchy-aware Graph Processing. | Xinbiao Gan, Guang Wu, Shenghao Qiu, Feng Xiong, Jiaqi Si, Jianbin Fang, Dezun Dong, Chunye Gong, Tiejun Li, Zheng Wang |
| 2023 | ICS | FT-topo: Architecture-Driven Folded-Triangle Partitioning for Communication-efficient Graph Processing. | Xinbiao Gan, Guang Wu, Ruigeng Zeng, Jiaqi Si, Ji Liu, Daxiang Dong, Chunye Gong, Cong Liu, Tiejun Li |
| 2022 | ISPA | Optimizing All-to-All Collective Communication on Tianhe Supercomputer. | Jintao Peng, Jie Liu, Yi Dai, Min Xie, Chunye Gong |
| 2021 | IJCNN | An efficient image to column algorithm for convolutional neural networks. | Chunye Gong, Xinhai Chen, Shuling Lv, Jie Liu, Bo Yang, Qinglin Wang, Weimin Bao, Yufei Pang, Yang Sun |
| 2019 | IJCNN | Parallel convolution algorithm using implicit matrix multiplication on multi-core CPUs. | Qinglin Wang, Songzhu Mei, Jie Liu, Chunye Gong |
| 2019 | PDCAT | Succinct Representations in Collaborative Filtering: A Case Study using Wavelet Tree on 1, 000 Cores. | Xiangjun Peng, Qingfeng Wang, Xu Sun, Chunye Gong, Yaohua Wang |
| 2012 | ICA3PP | High-Performance Matrix Multiply on a Massively Multithreaded Fiteng1000 Processor. | Jie Liu, Lihua Chi, Chunye Gong, Han Xu, Jie Jiang, Yihui Yan, Qingfeng Hu |
| 2010 | ICA3PP | Optimizing Sweep3D for Graphic Processor Unit. | Chunye Gong, Jie Liu, Zhenghu Gong, Jin Qin, Jing Xie |
| 2009 | FDTC | Differential Fault Analysis on SHACAL-1. | Ruilin Li, Chao Li, Chunye Gong |