| 2026 | ASPLOS | BitRed: Taming Non-Uniform Bit-Level Sparsity with a Programmable RISC-V ISA for DNN Acceleration. | Yanhuan Liu, Wenming Li, Kunming Zhang, Yuqun Liu, Siao Wen, Lexin Wang, Tianyu Liu, Haibin Wu, Zhihua Fan, Xiaochun Ye, Dongrui Fan, Xuejun An |
| 2026 | ISCA | MLX: Multi-Layer Execution for Structured LLM Workload Acceleration on Spatial Architectures. | Haibin Wu, Wenming Li, Zhihua Fan, Zirui Ma, Yuqun Liu, Tengfei Xia, Yanhuan Liu, Kunming Zhang, Xiaochun Ye, Dongrui Fan, Jian Weng |
| 2025 | DAC | MetaDSE: A Few-shot Meta-learning Framework for Cross-workload CPU Design Space Exploration. | Runzhen Xue, Hao Wu, Mingyu Yan, Ziheng Xiao, Xiaochun Ye, Dongrui Fan |
| 2025 | DATE | Accelerating Authenticated Block Ciphers via RISC-V Custom Cryptography Instructions. | Yuhang Qiu, Wenming Li, Tianyu Liu, Zhen Wang, Zhiyuan Zhang, Zhihua Fan, Xiaochun Ye, Dongrui Fan, Zhimin Tang |
| 2025 | DATE | LiGNN: Accelerating GNN Training Through Locality-Aware Dropout. | Gongjian Sun, Mingyu Yan, Dengke Han, Runzhen Xue, Xiaochun Ye, Dongrui Fan |
| 2025 | HPCC | TSCNN: Compressing and Accelerating Sparse CNNs Using Sign-Reserved Toeplitz Filters. | Zhen Wang, Tianyu Liu, Zhihua Fan, Yuhang Qiu, Zhiyuan Zhang, Wenming Li, Xiaochun Ye, Dongrui Fan |
| 2025 | ICA3PP | A GCN Accelerator with Unified Architecture. | Meng Wu, Mingyu Yan, Lei Deng, Wenming Li, Zhimin Zhang, Xiaochun Ye, Dongrui Fan |
| 2025 | ICCD | TLV-HGNN: Thinking Like a Vertex for Memory-Efficient HGNN Inference. | Dengke Han, Duo Wang, Mingyu Yan, Xiaochun Ye, Dongrui Fan |
| 2025 | ISCAS | StreamDCIM: A Tile-based Streaming Digital CIM Accelerator with Mixed-stationary Cross-forwarding Dataflow for Multimodal Transformer. | Shantian Qin, Ziqing Qiang, Zhihua Fan, Wenming Li, Xuejun An, Xiaochun Ye, Dongrui Fan |
| 2025 | ICS | JBSA: A Bit-Serial Accelerator for Deep Neural Networks Using Superconducting SFQ Logic. | Yang Su, Sheng Li, Huilong Jiang, Haofei Yin, Rongliang Fu, Junying Huang, Xiaochun Ye, Zhimin Zhang, Jie Ren, Xiaoping Gao, Tsung-Yi Ho, Dongrui Fan |
| 2025 | ISCAS | ITERTL: An Iterative Framework for Fine-tuning LLMs for RTL Code Generation. | Peiyang Wu, Nan Guo, Xiao Xiao, Wenming Li, Xiaochun Ye, Dongrui Fan |
| 2025 | ISLPED | A High-Performance Dataflow-Based ORB Extractor Accelerator for SLAM. | Rui Xue, Wenming Li, Haibin Wu, Cheng Guo, Yi Li, Xiaochun Ye, Dongrui Fan |
| 2025 | SIGIR | Leveraging Large Language Models for Effective Label-free Node Classification in Text-Attributed Graphs. | Taiyan Zhang, Renchi Yang, Yurui Lai, Mingyu Yan, Xiaochun Ye, Dongrui Fan |
| 2024 | DAC | GDR-HGNN: A Heterogeneous Graph Neural Networks Accelerator Frontend with Graph Decoupling and Recoupling. | Runzhen Xue, Mingyu Yan, Dengke Han, Yihan Teng, Zhimin Tang, Xiaochun Ye, Dongrui Fan |
| 2024 | DATE | JPlace: A Clock-Aware Length-Matching Placement for Rapid Single-Flux-Quantum Circuits. | Siyan Chen, Rongliang Fu, Junying Huang, Zhimin Zhang, Xiaochun Ye, Tsung-Yi Ho, Dongrui Fan |
| 2024 | EuroPar | GDL-GNN: Applying GPU Dataloading of Large Datasets for Graph Neural Network Inference. | Haoran Dang, Meng Wu, Mingyu Yan, Xiaochun Ye, Dongrui Fan |
| 2024 | EuroPar | ADE-HGNN: Accelerating HGNNs Through Attention Disparity Exploitation. | Dengke Han, Meng Wu, Runzhen Xue, Mingyu Yan, Xiaochun Ye, Dongrui Fan |
| 2024 | EuroPar | Disttack: Graph Adversarial Attacks Toward Distributed GNN Training. | Yuxiang Zhang, Xin Liu, Meng Wu, Wei Yan, Mingyu Yan, Xiaochun Ye, Dongrui Fan |
| 2024 | HPCC | OBSD: On-The-Fly Block-Wise Sparse Distillation Accelerating SpGEMMs in DNN Applications. | Yanhuan Liu, Wenming Li, Kunming Zhang, Zhihua Fan, Haibin Wu, Lexin Wang, Tianyu Liu, Yuhang Qiu, Zhen Wang, Xiaochun Ye, Dongrui Fan, Xuejun An |
| 2024 | ICA3PP | Accelerating Mini-batch HGNN Training by Reducing CUDA Kernels. | Meng Wu, Jingkai Qiu, Mingyu Yan, Wenming Li, Yang Zhang, Zhimin Zhang, Xiaochun Ye, Dongrui Fan |
| 2024 | SRDS | DTC: Real-Time and Accurate Distributed Triangle Counting in Fully Dynamic Graph Streams. | Wei Xuan, Yan Liang, Huawei Cao, Ning Lin, Xiaochun Ye, Dongrui Fan |
| 2023 | AAAI | Simple and Efficient Heterogeneous Graph Neural Network. | Xiaocheng Yang, Mingyu Yan, Shirui Pan, Xiaochun Ye, Dongrui Fan |
| 2023 | DAC | A High-accurate Multi-objective Exploration Framework for Design Space of CPU. | Duo Wang, Mingyu Yan, Xin Liu, Mo Zou, Tianyu Liu, Wenming Li, Xiaochun Ye, Dongrui Fan |
| 2023 | EuroPar | Improving Utilization of Dataflow Architectures Through Software and Hardware Co-Design. | Zhihua Fan, Wenming Li, Shengzhong Tang, Xuejun An, Xiaochun Ye, Dongrui Fan |
| 2023 | HPCC | ROMA: A Reconfigurable On-chip Memory Architecture for Multi-core Accelerators. | Shantian Qin, Wenming Li, Zhihua Fan, Zhen Wang, Tianyu Liu, Haibin Wu, Kunming Zhang, Xuejun An, Xiaochun Ye, Dongrui Fan |
| 2023 | ICCAD | A Transfer Learning Framework for High-Accurate Cross-Workload Design Space Exploration of CPU. | Duo Wang, Mingyu Yan, Yihan Teng, Dengke Han, Haoran Dang, Xiaochun Ye, Dongrui Fan |
| 2023 | ICCD | Alleviating Transfer Latency in DataFlow Accelerator for DSP Applications. | Haibin Wu, Wenming Li, Zhihua Fan, Zhen Wang, Tianyu Liu, Junying Huang, Shengzhong Tang, Yanhuan Liu, Kunming Zhang, Xiaochun Ye, Dongrui Fan |
| 2022 | DAC | Alleviating datapath conflicts and design centralization in graph analytics acceleration. | Haiyang Lin, Mingyu Yan, Duo Wang, Mo Zou, Fengbin Tu, Xiaochun Ye, Dongrui Fan, Yuan Xie |
| 2022 | DATE | LRP: Predictive output activation based on SVD approach for CNN s acceleration. | Xinxin Wu, Zhihua Fan, Tianyu Liu, Wenming Li, Xiaochun Ye, Dongrui Fan |
| 2022 | HPCC | A Loop Optimization Method for Dataflow Architecture. | Zhihua Fan, Wenming Li, Tianyu Liu, Shengzhong Tang, Zhen Wang, Xuejun An, Xiaochun Ye, Dongrui Fan |
| 2022 | ICA3PP | MatGraph: An Energy-Efficient and Flexible CGRA Engine for Matrix-Based Graph Analytics. | Long Tan, Mingyu Yan, Duo Wang, Wenming Li, Xiaochun Ye, Dongrui Fan |
| 2022 | ICA3PP | GEM: Execution-Aware Cache Management for Graph Analytics. | Mo Zou, Mingyu Yan, Wenming Li, Zhimin Tang, Xiaochun Ye, Dongrui Fan |
| 2022 | IJCAI | Survey on Graph Neural Network Acceleration: An Algorithmic Perspective. | Xin Liu, Mingyu Yan, Lei Deng, Guoqi Li, Xiaochun Ye, Dongrui Fan, Shirui Pan, Yuan Xie |
| 2022 | NPC | A Routing-Aware Mapping Method for Dataflow Architectures. | Zhihua Fan, Wenming Li, Tianyu Liu, Xuejun An, Xiaochun Ye, Dongrui Fan |
| 2021 | HPCA | Streamline Ring ORAM Accesses through Spatial and Temporal Optimization. | Dingyuan Cao, Mingzhe Zhang, Hang Lu, Xiaochun Ye, Dongrui Fan, Yuezhi Che, Rujia Wang |
| 2021 | ISPA | Alleviating Imbalance in Synchronous Distributed Training of Deep Neural Networks. | Haiyang Lin, Mingyu Yan, Duo Wang, Wenming Li, Xiaochun Ye, Zhimin Tang, Dongrui Fan |
| 2021 | SEKE | Triangle Counting by Adaptively Resampling over Evolving Graph Streams. | Wei Xuan, Huawei Cao, Mingyu Yan, Zhimin Tang, Xiaochun Ye, Dongrui Fan |
| 2020 | HPCA | HyGCN: A GCN Accelerator with Hybrid Architecture. | Mingyu Yan, Lei Deng, Xing Hu, Ling Liang, Yujing Feng, Xiaochun Ye, Zhimin Zhang, Dongrui Fan, Yuan Xie |
| 2020 | ICA3PP | CTA: A Critical Task Aware Scheduling Mechanism for Dataflow Architecture. | Yan Ou, Chongfei Shen, Yujing Feng, Xinxin Wu, Wenming Li, Xiaochun Ye, Dongrui Fan |
| 2020 | ICA3PP | Accelerating Sparse Convolutional Neural Networks Based on Dataflow Architecture. | Xinxin Wu, Yi Li, Yan Ou, Wenming Li, Shibo Sun, Wenxing Xu, Dongrui Fan |
| 2020 | ICONIP | Pixel-Semantic Revising of Position: One-Stage Object Detector with Shared Encoder-Decoder. | Qian Li, Nan Guo, Xiaochun Ye, Dongrui Fan, Zhimin Tang |
| 2020 | ISPA | Highly Efficient and GPU-Friendly Implementation of BFS on Single-node System. | Rongyu Dong, Huawei Cao, Xiaochun Ye, Yuan Zhang, Qinfen Hao, Dongrui Fan |
| 2019 | CVPR | Utilizing the Instability in Weakly Supervised Object Detection. | Boxiao Liu, Yan Gao, Nan Guo, Xiaochun Ye, Fang Wan, Haihang You, Dongrui Fan |
| 2019 | DAC | Magma: A Monolithic 3D Vertical Heterogeneous ReRAM-based Main Memory Architecture. | Farzaneh Zokaee, Mingzhe Zhang, Xiaochun Ye, Dongrui Fan, Lei Jiang |
| 2019 | HPCC | C-MAP: Improving the Effectiveness of Mapping Method for CGRA by Reducing NoC Congestion. | Shuqian An, Mingzhe Zhang, Xiaochun Ye, Da Wang, Hao Zhang, Dongrui Fan, Zhimin Tang |
| 2019 | HPCC | A Sharing Path Awareness Scheduling Algorithm for Dataflow Architecture. | Yi Li, Xu Tan, Rui Xue, Xiaochun Ye, Wenming Li, Da Wang, Hao Zhang, Dongrui Fan |
| 2019 | HPCC | Highly Efficient Breadth-First Search on CPU-Based Single-Node System. | Chenglong Zhang, Huawei Cao, Xiaochun Ye, Guobo Wang, Qinfen Hao, Dongrui Fan |
| 2019 | ICCV | C-MIDN: Coupled Multiple Instance Detection Network With Segmentation Guidance for Weakly Supervised Object Detection. | Gao Yan, Boxiao Liu, Nan Guo, Xiaochun Ye, Fang Wan, Haihang You, Dongrui Fan |
| 2019 | IOLTS | iATPG: Instruction-level Automatic Test Program Generation for Vulnerabilities under DVFS attack. | Kuozhong Zhang, Junying Huang, Jing Ye, Xiaochun Ye, Da Wang, Dongrui Fan, Huawei Li, Xiaowei Li, Zhimin Zhang |
| 2019 | ISLPED | Balancing Memory Accesses for Energy-Efficient Graph Analytics Accelerators. | Mingyu Yan, Xing Hu, Shuangchen Li, Itir Akgun, Han Li, Xin Ma, Lei Deng, Xiaochun Ye, Zhimin Zhang, Dongrui Fan, Yuan Xie |
| 2019 | MICRO | Alleviating Irregularity in Graph Analytics Acceleration: a Hardware/Software Co-Design Approach. | Mingyu Yan, Xing Hu, Shuangchen Li, Abanti Basak, Han Li, Xin Ma, Itir Akgun, Yujing Feng, Peng Gu, Lei Deng, Xiaochun Ye, Zhimin Zhang, Dongrui Fan, Yuan Xie |
| 2018 | HPCA | SmarCo: An Efficient Many-Core Processor for High-Throughput Applications in Datacenters. | Dongrui Fan, Wenming Li, Xiaochun Ye, Da Wang, Hao Zhang, Zhimin Tang, Ninghui Sun |
| 2018 | HPCC | Optimizing the Efficiency of Data Transfer in Dataflow Architectures. | Yujing Feng, Taoran Xiang, Xiaochun Ye, Dongrui Fan, Da Wang, Dongdong Wu, Zhimin Tang |
| 2018 | HPCC | Accelerating CNN Algorithm with Fine-Grained Dataflow Architectures. | Taoran Xiang, Yujing Feng, Xiaochun Ye, Xu Tan, Wenming Li, Yatao Zhu, Meng Wu, Hao Zhang, Dongrui Fan |
| 2018 | ISPA | WEAVER: An Energy Efficient, General-Purpose Acceleration Architecture for String Operations in Big Data Applications. | Wenming Li, Xiaochun Ye, Da Wang, Hao Zhang, Dongdong Wu, Zhimin Zhang, Dongrui Fan |
| 2018 | ISPA | High-Performance and Energy-Efficient Fault Tolerance Scheduling Algorithm Based on Improved TMR for Heterogeneous System. | Shigan Yu, Zhimin Tang, Xiaochun Ye, Zhimin Zhang, Dongrui Fan, Zhiying |
| 2017 | ICTAI | Hard Neighboring Variables Based Configuration Checking in Stochastic Local Search for Weighted Partial Maximum Satisfiability. | Yi Chu, Chuan Luo, Wenxuan Huang, Haihang You, Dongrui Fan |
| 2016 | HPCC | ACCC: An Acceleration Mechanism for Character Operation Based on Cache Computing in Big Data Applications. | Yuqiong Qi, Lina Ma, Wenming Li, Xiaochun Ye, Da Wang, Dongrui Fan, Ninghui Sun |
| 2015 | ATVA | ParaVerifier: An Automatic Framework for Proving Parameterized Cache Coherence Protocols. | Yongjian Li, Jun Pang, Yi Lv, Dongrui Fan, Shen Cao, Kaiqiang Duan |
| 2015 | MICRO | Enabling coordinated register allocation and thread-level parallelism optimization for GPUs. | Xiaolong Xie, Yun Liang, Xiuhong Li, Yudong Wu, Guangyu Sun, Tao Wang, Dongrui Fan |
| 2014 | ATVA | Efficiently and Completely Verifying Synchronized Consistency Models. | Yi Lv, Luming Sun, Xiaochun Ye, Dongrui Fan, Peng Wu |
| 2014 | SNPD | Optimizing mapreduce with low memory requirements for shared-memory systems. | Yasong Zheng, Yuanchao Xu, Haibo Meng, Xiaochun Ye, Lingjun Fan, Futao Miao, Dongrui Fan |
| 2013 | HPCC | Low Execution Efficiency: When General Multi-core Processor Meets Wireless Communication Protocol. | Fenglong Song, Yasong Zheng, Futao Miao, Xiaochun Ye, Hao Zhang, Dongrui Fan, Zhiyong Liu |
| 2013 | ISLPED | SimICT: A fast and flexible framework for performance and power evaluation of large-scale architecture. | Xiaochun Ye, Dongrui Fan, Ninghui Sun, Shibin Tang, Mingzhe Zhang, Hao Zhang |
| 2013 | PDCAT | HRUL: A Hardware Assisted Recorder for User-Level Application. | Shibin Tang, Fenglong Song, Lingjun Fan, Yuanchao Xu, Dongrui Fan, Zhiyong Liu |
| 2013 | PPoPP | Low power cache architectures with hybrid approach of filtering unnecessary way accesses. | Lingjun Fan, Shinan Wang, Yasong Zheng, Weisong Shi, Dongrui Fan |
| 2013 | TrustCom | Energy-Performance Modeling and Optimization of Parallel Computing in On-Chip Networks. | Shuai Zhang, Zhiyong Liu, Dongrui Fan, Fenglong Song, Mingzhe Zhang |
| 2013 | TrustCom | A Path-Adaptive Opto-electronic Hybrid NoC for Chip Multi-processor. | Mingzhe Zhang, Da Wang, Xiaochun Ye, Liqiang He, Dongrui Fan, Zhiyong Liu |
| 2012 | EuroPar | CRAW/P: A Workload Partition Method for the Efficient Parallel Simulation of Manycores. | Shuai Jiao, Paolo Ienne, Xiaochun Ye, Da Wang, Dongrui Fan, Ninghui Sun |
| 2012 | ICPADS | Auto-Tuning GEMV on Many-Core GPU. | Weizhi Xu, Zhiyong Liu, Jun Wu, Xiaochun Ye, Shuai Jiao, Da Wang, Fenglong Song, Dongrui Fan |
| 2012 | ISCAS | A SAT-based diagnosis pattern generation method for timing faults in scan chains. | Da Wang, Lunkai Zhang, Weizhi Xu, Dongrui Fan, Fei Wang |
| 2011 | CGO | Extendable pattern-oriented optimization directives. | Huimin Cui, Jingling Xue, Lei Wang, Yang Yang, Xiaobing Feng, Dongrui Fan |
| 2011 | PDCAT | Optimizing Web Browser on Many-Core Architectures. | Lingjun Fan, Weisong Shi, Shibin Tang, Chenggang Yan, Dongrui Fan |
| 2010 | EuroPar | Preliminary Investigation of Accelerating Molecular Dynamics Simulation on Godson-T Many-Core Processor. | Liu Peng, Guangming Tan, Rajiv K. Kalia, Aiichiro Nakano, Priya Vashishta, Dongrui Fan, Ninghui Sun |
| 2010 | EuroPar | Efficient Address Mapping of Shared Cache for On-Chip Many-Core Architecture. | Fenglong Song, Dongrui Fan, Zhiyong Liu, Junchao Zhang, Lei Yu, Weizhi Xu |
| 2010 | EuroPar | Thread Owned Block Cache: Managing Latency in Many-Core Architecture. | Fenglong Song, Zhiyong Liu, Dongrui Fan, Hao Zhang, Lei Yu, Shibin Tang |
| 2010 | MICRO | Minimal Multi-threading: Finding and Removing Redundant Instructions in Multi-threaded Processors. | Guoping Long, Diana Franklin, Susmit Biswas, Pablo J. Ortiz, Jason Oberg, Dongrui Fan, Frederic T. Chong |
| 2010 | PADS | P-GAS: Parallelizing a Cycle-Accurate Event-Driven Many-Core Processor Simulator Using Parallel Discrete Event Simulation. | Huiwei Lv, Yuan Cheng, Lu Bai, Mingyu Chen, Dongrui Fan, Ninghui Sun |
| 2009 | EuroPar | Characterizing and Understanding the Bandwidth Behavior of Workloads on Multi-core Processors. | Guoping Long, Dongrui Fan, Junchao Zhang |
| 2009 | EuroPar | High Performance Matrix Multiplication on Many Cores. | Nan Yuan, Yongbin Zhou, Guangming Tan, Junchao Zhang, Dongrui Fan |
| 2009 | ISPA | A Synchronization-Based Alternative to Directory Protocol. | He Huang, Lei Liu, Nan Yuan, Wei Lin, Fenglong Song, Junchao Zhang, Dongrui Fan |
| 2009 | ISPA | Evaluation Method of Synchronization for Shared-Memory On-Chip Many-Core Processor. | Fenglong Song, Zhiyong Liu, Dongrui Fan, He Huang, Nan Yuan, Lei Yu, Junchao Zhang |
| 2009 | ISPA | Data Management: The Spirit to Pursuit Peak Performance on Many-Core Processor. | Yongbin Zhou, Junchao Zhang, Shuai Zhang, Nan Yuan, Dongrui Fan |
| 2009 | NPC | GFFC: The Global Feedback Based Flow Control in the NoC Design for Many-core Processor. | Xu Wang, Ge Gan, Dongrui Fan, Shuxu Guo |
| 2009 | PPoPP | Architectural support for cilk computations on many-core architectures. | Guoping Long, Dongrui Fan, Junchao Zhang |
| 2009 | SNPD | Study on Fine-Grained Synchronization in Many-Core Architecture. | Lei Yu, Zhiyong Liu, Dongrui Fan, Fenglong Song, Junchao Zhang, Nan Yuan |
| 2008 | EuroPar | A Performance Model of Dense Matrix Operations on Many-Core Architectures. | Guoping Long, Dongrui Fan, Junchao Zhang, Fenglong Song, Nan Yuan, Wei Lin |
| 2008 | ICPADS | A Quantitative Study of the On-Chip Network and Memory Hierarchy Design for Many-Core Processor. | Xu Wang, Ge Gan, Joseph B. Manzano, Dongrui Fan, Shuxu Guo |
| 2008 | PDCAT | Location Consistency Model Revisited: Problem, Solution and Prospects. | Guoping Long, Nan Yuan, Dongrui Fan |
| 2008 | PDCAT | Efficient Parallelization of a Protein Sequence Comparison Algorithm on Manycore Architecture. | Xiaochun Ye, Van Hoa Nguyen, Dominique Lavenier, Dongrui Fan |
| 2008 | PPoPP | Experience on optimizing irregular computation for memory hierarchy in manycore architecture. | Guangming Tan, Dongrui Fan, Junchao Zhang, Andrew Russo, Guang R. Gao |
| 2007 | ISCAS | Circuit implementation of floating point range reduction for trigonometric functions. | Xuehai Qian, Hao Zhang, Jingang Yang, He Huang, Junchao Zhang, Dongrui Fan |
| 2007 | PDP | Design and Implementation of Floating Point Stack on General RISC Architecture. | Xuehai Qian, He Huang, Hao Zhang, Guoping Long, Junchao Zhang, Dongrui Fan |
| 2005 | ISLPED | An energy efficient TLB design methodology. | Dongrui Fan, Zhimin Tang, Hailin Huang, Guang R. Gao |