| 2026 | AAAI | FUSION: Dataset Pruning via Fusing Uncertainty with Structural Information for Optimal Neural Training in Crystal Property Prediction. | Xiean Wang, Pin Chen, Liqin Tan, Yutong Lu, Qingsong Zou |
| 2026 | ACL | AscendKernelGen: LLM-Driven Kernel Generation for NPUs. | Xinzi Cao, Jianyang Zhai, Pengfei Li, Zhiheng Hu, Cen Yan, Bingxu Mu, Guanghuan Fang, Bin She, Jiayu Li, Yihan Su, Dongyang Tao, Feidiao Yang, Chang-Dong Wang, Yutong Lu, Weicheng Xue, Bin Zhou, Yonghong Tian |
| 2026 | ACL | FLARE: Fine-Grained Length-Aware Routing for Resource-Efficient Heterogeneous LLM Serving. | Yujia Fu, Heming Zhong, Dan Huang, Yutong Lu |
| 2026 | ASPLOS | Bullet: Boosting GPU Utilization for LLM Serving via Dynamic Spatial-Temporal Orchestration. | Zejia Lin, Hongxin Xu, Guanyi Chen, Zhiguang Chen, Yutong Lu, Xianwei Zhang |
| 2026 | DATE | KirbyMM: Outer-Product Based Matrix Multiplication on ARMv9 Processor. | Lanshu Huang, Han Huang, Zhiguang Chen, Yutong Lu |
| 2026 | EuroPar | SMEAtten: Fast and Memory-Efficient Outer Product-Based Attention on ARMv9 CPUs with SME. | Tengyang Zheng, Han Huang, Junru Chen, Xianwei Zhang, Yutong Lu |
| 2026 | EuroSys | Matrix‑PIC: Harnessing Matrix Outer-product for High‑Performance Particle‑in‑Cell Simulations. | Yizhuo Rao, Xingjian Cui, Jiabin Xie, Shangzhi Pang, Guangnan Feng, Jinhui Wei, Zhiguang Chen, Yutong Lu |
| 2026 | HPCA | SFD: Towards Segment Fusion Dataflow for Spatial Accelerators. | Fuyu Wang, Minghua Shen, Yufei Ding, Nong Xiao, Yutong Lu |
| 2026 | HPDC | POLAR-PIC: A Holistic Framework for Matrixized PIC with Co-Designed Compute, Layout, and Communication. | Yizhuo Rao, Xingjian Cui, Shangzhi Pang, Jiabin Xie, Guangnan Feng, Ziyan Zhang, Jinhui Wei, Languang Gao, Zhenyu Wang, Zhiguang Chen, Yutong Lu |
| 2026 | ICS | TADS: Trend-Aware Dynamic Load Balancing for Large-Scale SNN Simulations with Delay-Sharded Graph Infrastructure. | Hao Huang, Shangzhi Pang, Yangle Zeng, Guangnan Feng, Zhiguang Chen, Yutong Lu |
| 2026 | ICS | PolyKAN: A High-Performance and Universal GPU Operator Library for Polynomial Kolmogorov-Arnold Networks. | Mingkun Yu, Heming Zhong, Jiazhi Jiang, Dan Huang, Yutong Lu |
| 2026 | PPoPP | ASM-SpMM: Unleashing the Potential of Arm SME for Sparse Matrix Multiplication Acceleration. | Jiazhi Jiang, Xijia Yao, Jiayu Chen, Jinhui Wei, Dan Huang, Yutong Lu |
| 2026 | WCNC | Robust Non-Linear Transceiver Design for Multicarrier MIMO SWIPT. | Yutong Lu, Peiran Wu, Xingxiang Peng, Tianheng Wang |
| 2025 | DAC | GoPTX: Fine-grained GPU Kernel Fusion by PTX-level Instruction Flow Weaving. | Kan Wu, Zejia Lin, Mengyue Xi, Zhongchun Zheng, Wenxuan Pan, Xianwei Zhang, Yutong Lu |
| 2025 | ICCD | AuLoRA: Fine-Grained Loading and Computation Orchestration for Efficient LoRA LLM Serving. | Xiao Shi, Jiangsu Du, Zhiguang Chen, Yutong Lu |
| 2025 | ICCD | IasRT: Interference-Aware and SLO-Driven GPU Scheduling for Real-Time DNN Inference. | Heming Zhong, Jinhui Wei, Yujia Fu, Dan Huang, Yutong Lu |
| 2025 | ICCV | ALLGCD: Leveraging All Unlabeled Data for Generalized Category Discovery. | Xinzi Cao, Ke Chen, Feidiao Yang, Xiawu Zheng, Yonghong Tian, Yutong Lu |
| 2025 | ICLR | ECD: A Machine Learning Benchmark for Predicting Enhanced-Precision Electronic Charge Density in Crystalline Inorganic Materials. | Pin Chen, Zexin Xu, Qing Mo, Hongjin Zhong, Fengyang Xu, Yutong Lu |
| 2025 | ICLR | CL-MFAP: A Contrastive Learning-Based Multimodal Foundation Model for Molecular Property Prediction and Antibiotic Screening. | Gen Zhou, Sugitha Janarthanan, Yutong Lu, Pingzhao Hu |
| 2025 | ICPP | TD-Pipe: Temporally-Disaggregated Pipeline Parallelism Architecture for High-Throughput LLM Inference. | Hongbin Zhang, Taosheng Wei, Zhenyi Zheng, Jiangsu Du, Zhiguang Chen, Yutong Lu |
| 2025 | IJCAI | CFDONEval: A Comprehensive Evaluation of Operator-Learning Neural Network Models for Computational Fluid Dynamics. | Menghan Liu, Jianhuan Cen, Ziyang Zhou, Haolong Fan, Hongji Li, Ping Wei, Guohang Peng, Changye He, Yuzhe Qin, Yutong Lu, Qingsong Zou |
| 2025 | WCNC | A Unified Optimization Framework for Multicarrier MIMO SWIPT Systems. | Yutong Lu, Xingxiang Peng, Peiran Wu, Minghua Xia, Teng Sun |
| 2025 | SC | gLLM: Global Balanced Pipeline Parallelism Systems for Distributed LLMs Serving with Token Throttling. | Tianyu Guo, Xianwei Zhang, Jiangsu Du, Zhiguang Chen, Nong Xiao, Yutong Lu |
| 2025 | SC | coMtainer: Compilation-assisted HPC Container Images with Enhanced Adaptability. | Yuhao Gu, Haoquan Chen, Xianjie Chen, Jiangsu Du, Zhiguang Chen, Nong Xiao, Xianwei Zhang, Yutong Lu |
| 2025 | SC | HStencil: Matrix-Vector Stencil Computation with Interleaved Outer Product and MLA. | Han Huang, Jiabin Xie, Guangnan Feng, Xianwei Zhang, Dan Huang, Zhiguang Chen, Yutong Lu |
| 2024 | CLUSTER | Welcome Message from the IEEE Cluster 2024 Program Chairs. | Yutong Lu, Wu-chun Feng, Mohamed Wahib |
| 2024 | CVPR | Solving the Catastrophic Forgetting Problem in Generalized Category Discovery. | Xinzi Cao, Xiawu Zheng, Guanhong Wang, Weijiang Yu, Yunhang Shen, Ke Li, Yutong Lu, Yonghong Tian |
| 2024 | DATE | Communication-Efficient Model Parallelism for Distributed In-Situ Transformer Inference. | Yuanxin Wei, Shengyuan Ye, Jiazhi Jiang, Xu Chen, Dan Huang, Jiangsu Du, Yutong Lu |
| 2024 | EuroPar | Efficient Coupling Streaming AI and Ensemble Simulations on HPC Clusters. | Jiazhi Jiang, Hongbin Zhang, Deyin Liu, Jiangsu Du, Xiaojiao Yao, Jinhui Wei, Pin Chen, Dan Huang, Yutong Lu |
| 2024 | ICML | Equivariant Diffusion for Crystal Structure Prediction. | Peijia Lin, Pin Chen, Rui Jiao, Qing Mo, Jianhuan Cen, Wenbing Huang, Yang Liu, Dan Huang, Yutong Lu |
| 2024 | INFOCOM | Galaxy: A Resource-Efficient Collaborative Edge AI System for In-situ Transformer Inference. | Shengyuan Ye, Jiangsu Du, Liekang Zeng, Wenzhong Ou, Xiaowen Chu, Yutong Lu, Xu Chen |
| 2024 | ISPA | SparkTH: NUMA-Aware and I/O-Efficient Spark for ARM-Based Many-Core Supercomputing System. | Nan Hu, Minguang Xiao, Zhiguang Chen, Yutong Lu |
| 2024 | ISPA | ATM: Area-based Partition and Topology-aware Mapping for Large-scale SNN Simulation. | Yangle Zeng, Guangnan Feng, Zhiguang Chen, Yutong Lu, Nong Xiao |
| 2024 | PPoPP | Liger: Interleaving Intra- and Inter-Operator Parallelism for Distributed Large Model Inference. | Jiangsu Du, Jinhui Wei, Jiazhi Jiang, Shenggan Cheng, Dan Huang, Zhiguang Chen, Yutong Lu |
| 2024 | PPoPP | Extreme-scale Direct Numerical Simulation of Incompressible Turbulence on the Heterogeneous Many-core System. | Jiabin Xie, Guangnan Feng, Han Huang, Junxuan Feng, Zhiguang Chen, Yutong Lu |
| 2024 | SC | UNR: Unified Notifiable RMA Library for HPC. | Guangnan Feng, Jiabin Xie, Dezun Dong, Yutong Lu |
| 2024 | SC | APTMoE: Affinity-Aware Pipeline Tuning for MoE Models on Bandwidth-Constrained GPU Nodes. | Yuanxin Wei, Jiangsu Du, Jiazhi Jiang, Xiao Shi, Xianwei Zhang, Dan Huang, Nong Xiao, Yutong Lu |
| 2023 | DATE | Accelerating Inference of 3D-CNN on ARMMany-core CPU via Hierarchical Model Partition. | Jiazhi Jiang, Zijiang Huang, Dan Huang, Jiangsu Du, Yutong Lu |
| 2023 | ICCD | MixRec: Orchestrating Concurrent Recommendation Model Training on CPU-GPU platform. | Jiazhi Jiang, Rui Tian, Jiangsu Du, Dan Huang, Yutong Lu |
| 2023 | ICCD | KeSCo: Compiler-based Kernel Scheduling for Multi-task GPU Applications. | Zejia Lin, Zewei Mo, Xuanteng Huang, Xianwei Zhang, Yutong Lu |
| 2023 | ICS | GRAP: Group-level Resource Allocation Policy for Reconfigurable Dragonfly Network in HPC. | Guangnan Feng, Dezun Dong, Shizhen Zhao, Yutong Lu |
| 2022 | CCGRID | RAISE: Efficient GPU Resource Management via Hybrid Scheduling. | Yue Weng, Tianao Ge, Xi Zhang, Xianwei Zhang, Yutong Lu |
| 2022 | DAC | Exploiting data locality in memory for ORAM to reduce memory access overheads. | Jinxi Kuang, Minghua Shen, Yutong Lu, Nong Xiao |
| 2022 | ICPP | Characterizing and Optimizing Transformer Inference on ARM Many-core Processor. | Jiazhi Jiang, Jiangsu Du, Dan Huang, Dongsheng Li, Jiang Zheng, Yutong Lu |
| 2022 | ICS | Handling heavy-tailed input of transformer inference on GPUs. | Jiangsu Du, Jiazhi Jiang, Yang You, Dan Huang, Yutong Lu |
| 2022 | ICS | Optimized MPI collective algorithms for dragonfly topology. | Guangnan Feng, Dezun Dong, Yutong Lu |
| 2021 | AAAI | Multi-Layer Networks for Ensemble Precipitation Forecasts Postprocessing. | Fengyang Xu, Guanbin Li, Yunfei Du, Zhiguang Chen, Yutong Lu |
| 2021 | ICCV | Self-Motivated Communication Agent for Real-World Vision-Dialog Navigation. | Yi Zhu, Yue Weng, Fengda Zhu, Xiaodan Liang, Qixiang Ye, Yutong Lu, Jianbin Jiao |
| 2021 | ICPP | Optimizing Massively Parallel Winograd Convolution on ARM Processor. | Dongsheng Li, Dan Huang, Zhiguang Chen, Yutong Lu |
| 2021 | ISPA | A Fine-grained Optimization to Winograd Convolution Based on Micro-architectural Features of CPU. | Xiaofeng Chen, Zhiguang Chen, Yutong Lu, Dan Huang |
| 2021 | SC | Krill: a compiler and runtime system for concurrent graph processing. | Hongzheng Chen, Minghua Shen, Nong Xiao, Yutong Lu |
| 2020 | HPCC | An Efficient Approach to Vectorize the Hybrid Breadth-First Search. | Chi Zhu, Weixuan Shi, Zhiguang Chen, Nong Xiao, Yutong Lu |
| 2020 | ICANN | Synthesis of Registered Multimodal Medical Images with Lesions. | Yili Qu, Wanqi Su, Xuan Lv, Chufu Deng, Ying Wang, Yutong Lu, Zhiguang Chen, Nong Xiao |
| 2020 | ICCE | Game-Based Learning in Language Education: A Review of Empirical Studies from 2009 to 2018. | Chang Xu, Xian Zhang, Xiaohan Yu, Yutong Lu, Chunping Zheng |
| 2020 | IJCAI | Phishing Scam Detection on Ethereum: Towards Financial Security for Blockchain Ecosystem. | Weili Chen, Xiongfeng Guo, Zhiguang Chen, Zibin Zheng, Yutong Lu |
| 2020 | IJCAI | Communicative Representation Learning on Attributed Molecular Graphs. | Ying Song, Shuangjia Zheng, Zhangming Niu, Zhang-Hua Fu, Yutong Lu, Yuedong Yang |
| 2020 | WWW | Traveling the token world: A graph analysis of Ethereum ERC20 token ecosystem. | Weili Chen, Tuo Zhang, Zhiguang Chen, Zibin Zheng, Yutong Lu |
| 2020 | SBAC-PAD | Re-evaluation of Atomic Operations and Graph Coloring for Unstructured Finite Volume GPU Simulations. | Xi Zhang, Xu Sun, Xiaohu Guo, Yunfei Du, Yutong Lu, Yang Liu |
| 2019 | CIKM | An Active and Deep Semantic Matching Framework for Query Rewrite in E-Commercial Search Engine. | Yatao Yang, Jun Tan, Hongbo Deng, Zibin Zheng, Yutong Lu, Xiangke Liao |
| 2019 | HPCC | IndexIt: Enhancing Data Locating Services for Parallel File Systems. | Peng Cheng, Yong Wang, Yutong Lu, Yunfei Du, Zhiguang Chen |
| 2019 | HPCC | An Efficient Data Collection Module on Petascale Systems. | Huang Huang, Tong Xiao, Chuanying Li, Can Leng, Yutong Lu |
| 2019 | HPCC | Bi-Cluster: A High-Performance Data Query Framework for Large-Scale Scientific Data. | Yixian Shen, Cheng Peng, Yunfei Du, Yutong Lu |
| 2019 | ICCD | An Efficient and Flexible Metadata Management Layer for Local File Systems. | Yubo Liu, Hongbo Li, Yutong Lu, Zhiguang Chen, Ming Zhao |
| 2019 | NPC | Optimizing Data Placement on Hierarchical Storage Architecture via Machine Learning. | Peng Cheng, Yutong Lu, Yunfei Du, Zhiguang Chen, Yang Liu |
| 2018 | HPCC | Accelerating Scientific Workflows with Tiered Data Management System. | Peng Cheng, Yutong Lu, Yunfei Du, Zhiguang Chen |
| 2018 | HPCC | DistForest: A Parallel Random Forest Training Framework Based on Supercomputer. | Chenxu Wang, Tingting Cai, Guang Suo, Yutong Lu, Enqiang Zhou |
| 2018 | ICA3PP | A Low Communication Overhead Breadth-First Search Based on Global Bitmap. | Ziwei Peng, Yutong Lu, Zhiguang Cheng, Yunfei Du |
| 2018 | ICPADS | On the Power of Combiner Optimizations in MapReduce Over MPI Workflows. | Tao Gao, Yanfei Guo, Boyu Zhang, Pietro Cicotti, Yutong Lu, Pavan Balaji, Michela Taufer |
| 2018 | NPC | Mimir+: An Optimized Framework of MapReduce on Heterogeneous High-Performance Computing System. | Nan Hu, Zhiguang Chen, Yunfei Du, Yutong Lu |
| 2017 | CCGRID | mD3DOCKxb: An Ultra-Scalable CPU-MIC Coordinated Virtual Screening Framework. | Shaoliang Peng, Xiaoyu Zhang, Shunyun Yang, Wenhe Su, Zhiqiang Zhang, Dong Dong, Kai Lu, Yutong Lu, Xiangke Liao, Bertil Schmidt, Weiliang Zhu, Kuan-Ching Li |
| 2017 | DASC | Review on HDD-Based, SSD-Based and Hybrid Key-Value Stores. | Juan Li, Nong Xiao, Yutong Lu, Zhiguang Chen, Fang Liu, Yuxuan Xing, Shuo Li |
| 2017 | ICPADS | Bloomfish: A Highly Scalable Distributed K-mer Counting Framework. | Tao Gao, Yanfei Guo, Yanjie Wei, Bingqiang Wang, Yutong Lu, Pietro Cicotti, Pavan Balaji, Michela Taufer |
| 2016 | ICPADS | masFS: File System Based on Memory and SSD in Compute Nodes for High Performance Computers. | Xin Liu, Ying Lu, Yutong Lu, Chunjia Wu, Jieting Wu |
| 2016 | ICPADS | Accelerating the Simulation of Thermal Convection in the Earth's Outer Core on Tianhe-2. | Changmao Wu, Fangfang Liu, Chao Yang, Ligang Li, Haitao Zhao, Yutong Lu, Leisheng Li, Yunfei Du |
| 2016 | ICWS | Persistence and Recovery for In-Memory NoSQL Services: A Measurement Study. | Xianqiang Bao, Ling Liu, Nong Xiao, Yutong Lu, Wenqi Cao |
| 2016 | SC | The Gyrokinetic Particle Simulation of Fusion Plasmas on Tianhe-2 Supercomputer. | Endong Wang, Shaohua Wu, Qing Zhang, Jun Liu, Wenlu Zhang, Zhihong Lin, Yutong Lu, Yunfei Du, Xiaoqian Zhu |
| 2016 | TrustCom | Using Dynamic Granularity Strategy to Accelerate Unbalanced Tree Search. | Lei Guan, Yutong Lu |
| 2015 | CCGRID | mD3DOCKxb: A Deep Parallel Optimized Software for Molecular Docking with Intel Xeon Phi Coprocessors. | Qian Cheng, Shaoliang Peng, Yutong Lu, Weiliang Zhu, Zhijian Xu, Xinben Zhang |
| 2015 | CCGRID | HAGP: A Hub-Centric Asynchronous Graph Processing Framework for Scale-Free Graph. | Tao Gao, Yutong Lu, Baida Zhang |
| 2015 | CCGRID | The Challenge of Scaling Genome Big Data Analysis Software on TH-2 Supercomputer. | Shaoliang Peng, Xiangke Liao, Canqun Yang, Yutong Lu, Jie Liu, Yingbo Cui, Heng Wang, Chengkun Wu, Bingqiang Wang |
| 2015 | ICA3PP | Performance Evaluation of HPGMG on Tianhe-2: Early Experience. | Yulong Ao, Yiqung Liu, Chao Yang, Fangfang Liu, Peng Zhang, Yutong Lu, Yunfei Du |
| 2015 | IECON | Thresholds modification strategy of wayside supercapacitor storage considering DC substation characteristics. | Junxing Wang, Zhongping Yang, Fei Lin, Yajie Zhao, Huan Xia, Yutong Lu, Xiaohao Zhao |
| 2015 | UIC | CoGA: Extension of GA on Heterogeneous System. | Peng Cheng, Yutong Lu, Tao Gao, Chenxu Wang |
| 2014 | ICA3PP | Optimizing and Scaling HPCG on Tianhe-2: Early Experience. | Xianyi Zhang, Chao Yang, Fangfang Liu, Yiqung Liu, Yutong Lu |
| 2014 | ICPADS | Accelerating HPCG on Tianhe-2: A hybrid CPU-MIC algorithm. | Yiqung Liu, Xianyi Zhang, Chao Yang, Fangfang Liu, Yutong Lu |
| 2014 | ICPADS | Physically based parallel ray tracer for the Metropolis light transport algorithm on the Tianhe-2 supercomputer. | Changmao Wu, Yunquan Zhang, Congli Yang, Yutong Lu |
| 2014 | ICS | Improving performance by matching imbalanced workloads with heterogeneous platforms. | Jie Shen, Ana Lucia Varbanescu, Peng Zou, Yutong Lu, Henk J. Sips |
| 2014 | SC | Efficient Shared-Memory Implementation of High-Performance Conjugate Gradient Benchmark and its Application to Unstructured Matrices. | Jongsoo Park, Mikhail Smelyanskiy, Karthikeyan Vaidyanathan, Alexander Heinecke, Dhiraj D. Kalamkar, Xing Liu, Md. Mostofa Ali Patwary, Yutong Lu, Pradeep Dubey |
| 2013 | ICPADS | NR-MPI: A Non-stop and Fault Resilient MPI. | Guang Suo, Yutong Lu, Xiangke Liao, Min Xie, Hongjia Cao |
| 2013 | PPoPP | A peta-scalable CPU-GPU algorithm for global atmospheric simulations. | Chao Yang, Wei Xue, Haohuan Fu, Lin Gan, Linfeng Li, Yangtong Xu, Yutong Lu, Jiachang Sun, Guangwen Yang, Weimin Zheng |
| 2012 | NPC | EaSync: A Transparent File Synchronization Service across Multiple Machines. | Huajian Mao, Hang Zhang, Xianqiang Bao, Nong Xiao, Weisong Shi, Yutong Lu |
| 2011 | HOTI | Implementation and Evaluation of Network Interface and Message Passing Services for TianHe-1A Supercomputer. | Min Xie, Yutong Lu, Lu Liu, Hongjia Cao, Xuejun Yang |
| 2006 | APWEB | A New Heartbeat Mechanism for Large-Scale Cluster. | Yutong Lu, Min Wang, Nong Xiao |
| 2005 | ISPA | MCRM System: CIM-Based Multiple Clusters Manager. | Yutong Lu, Zhiyu Shen, Enqiang Zhou, Min Zhu |