| 2025 | ICCAD | NeuroPDE: A Neuromorphic PDE Solver Based on Spintronic and Ferroelectric Devices. | Siqing Fu, Lizhou Wu, Tiejun Li, Chunyuan Zhang, Sheng Ma, Jianmin Zhang, Yuhan Tang, Jixuan Tang |
| 2024 | ICPR | AFMA-Track: Adaptive Fusion of Motion and Appearance for Robust Multi-object Tracking. | Wei Liao, Lei Luo, Chunyuan Zhang |
| 2022 | ICCD | BP-Im2col: Implicit Im2col Supporting AI Backpropagation on Systolic Arrays. | Jianchao Yang, Mei Wen, Junzhong Shen, Yasong Cao, Minjin Tang, Renyu Yang, Jiawei Fei, Chunyuan Zhang |
| 2021 | HPCC | SAI: Self-Adjusting Incremental Quantile Estimation for Sparse Training of Neural Networks on Hardware Accelerators. | Jianchao Yang, Mei Wen, Minjin Tang, Junzhong Shen, Chunyuan Zhang |
| 2020 | DAC | Towards Memory-Efficient Streaming Processing with Counter-Cascading Sketching on FPGA. | Minjin Tang, Mei Wen, Junzhong Shen, Xiaolei Zhao, Chunyuan Zhang |
| 2020 | FPGA | Scalable FPGA-based Architecture for High-Performance Per-Flow Traffic Measurement. | Junzhong Shen, Mei Wen, Minjin Tang, Xiaolei Zhao, Chunyuan Zhang |
| 2020 | ICA3PP | Towards a Deep-Pipelined Architecture for Accelerating Deep GCN on a Multi-FPGA Platform. | Qixuan Cheng, Mei Wen, Junzhong Shen, Deguang Wang, Chunyuan Zhang |
| 2020 | ICA3PP | Optimized HybridSketch: More Efficient with Analysis and Algorithm. | Xiaolei Zhao, Mei Wen, Minjin Tang, Qun Huang, Chunyuan Zhang |
| 2020 | ICPP | Towards High-Efficiency Data Centers via Job-Aware Network Scheduling. | Yang Shi, Mei Wen, Chunyuan Zhang |
| 2020 | ISCC | Incremental Deployment of Programmable Switches for Sketch-based Network Measurement. | Yang Shi, Mei Wen, Chunyuan Zhang |
| 2019 | DAC | Scale-out Acceleration for 3D CNN-based Lung Nodule Segmentation on a Multi-FPGA System. | Junzhong Shen, Deguang Wang, You Huang, Mei Wen, Chunyuan Zhang |
| 2019 | DATE | GENIE: QoS-guided Dynamic Scheduling for CNN-based Tasks on SME Clusters. | Zhaoyun Chen, Lei Luo, Haoduo Yang, Jie Yu, Mei Wen, Chunyuan Zhang |
| 2019 | FPGA | Accelerating 3D CNN-based Lung Nodule Segmentation on a Multi-FPGA System. | Junzhong Shen, Deguang Wang, You Huang, Mei Wen, Chunyuan Zhang |
| 2019 | HPCC | SACC: Configuring Application-Level Cache Intelligently for In-Memory Database Based on Long Short-Term Memory. | Jiawei Fei, Yang Shi, Mei Wen, Chunyuan Zhang |
| 2019 | HPCC | TBSW: Time-Based Sliding Window Algorithm for Network Traffic Measurement. | Zijun Hang, Yang Shi, Mei Wen, Chunyuan Zhang |
| 2019 | ICPP | An Efficient Design Flow for Accelerating Complicated-connected CNNs on a Multi-FPGA Platform. | Deguang Wang, Junzhong Shen, Mei Wen, Chunyuan Zhang |
| 2019 | INFOCOM | Poster Abstract: A Template-based Framework for Generating Network Processor in FPGA. | Zhuang Cao, Huayou Su, Qianming Yang, Mei Wen, Chunyuan Zhang |
| 2019 | INFOCOM | Poster Abstract: Deep Learning Workloads Scheduling with Reinforcement Learning on GPU Clusters. | Zhaoyun Chen, Lei Luo, Wei Quan, Mei Wen, Chunyuan Zhang |
| 2019 | ISCAS | Towards a Uniform Architecture for the Efficient Implementation of 2D and 3D Deconvolutional Neural Networks on FPGAs. | Deguang Wang, Junzhong Shen, Mei Wen, Chunyuan Zhang |
| 2019 | ISCC | KVSwitch: An In-network Load Balancer for Key-Value Stores. | Yang Shi, Jiawei Fei, Mei Wen, Chunyuan Zhang |
| 2018 | FPGA | Towards a Uniform Template-based Architecture for Accelerating 2D and 3D CNNs on FPGA. | Junzhong Shen, You Huang, Zelong Wang, Yuran Qiao, Mei Wen, Chunyuan Zhang |
| 2018 | HPCC | Multiple CNN-based Tasks Scheduling across Shared GPU Platform in Research and Development Scenarios. | Zhaoyun Chen, Lei Luo, Wei Quan, Yang Shi, Jie Yu, Mei Wen, Chunyuan Zhang |
| 2018 | ISCAS | Towards a Multi-array Architecture for Accelerating Large-scale Matrix Multiplication on FPGAs. | Junzhong Shen, Yuran Qiao, You Huang, Mei Wen, Chunyuan Zhang |
| 2018 | SIGCSE | Design of Practical Experiences to Improve Student Understanding of Efficiency and Scalability Issues in High Performance Computing: (Abstract Only). | Juan Chen, Li Shen, Jianping Yin, Chunyuan Zhang |
| 2017 | ICANN | Winograd Algorithm for 3D Convolution Neural Networks. | Zelong Wang, Qiang Lan, Hongjun He, Chunyuan Zhang |
| 2017 | NPC | Optimizing OpenCL Implementation of Deep Convolutional Neural Network on FPGA. | Yuran Qiao, Junzhong Shen, Dafei Huang, Qianming Yang, Mei Wen, Chunyuan Zhang |
| 2016 | ICPADS | Enabling Tissue-Scale Cardiac Simulations Using Heterogeneous Computing on Tianhe-2. | Johannes Langguth, Qiang Lan, Namit Gaur, Xing Cai, Mei Wen, Chunyuan Zhang |
| 2015 | BMVC | Enable Scale and Aspect Ratio Adaptability in Visual Tracking with Detection Proposals. | Dafei Huang, Lei Luo, Mei Wen, Zhaoyun Chen, Chunyuan Zhang |
| 2015 | ICIP | Fast tracking via context depth model learning. | Zhaoyun Chen, Lei Luo, Mei Wen, Chunyuan Zhang |
| 2014 | DATE | A fault detection mechanism in a Data-flow scheduled Multithreaded processor. | Jian Fu, Qiang Yang, Raphael Poss, Chris R. Jesshope, Chunyuan Zhang |
| 2014 | EuroPar | Automated Transformation of GPU-Specific OpenCL Kernels Targeting Performance Portability on Multi-Core/Many-Core CPUs. | Dafei Huang, Mei Wen, Changqing Xun, Dong Chen, Xing Cai, Yuran Qiao, Nan Wu, Chunyuan Zhang |
| 2014 | ICA3PP | Utilizing Multiple Xeon Phi Coprocessors on One Compute Node. | Xinnan Dong, Jun Chai, Jing Yang, Mei Wen, Nan Wu, Xing Cai, Chunyuan Zhang, Zhaoyun Chen |
| 2013 | HPCC | Automatic Mapping Single-Device OpenCL Program to Heterogeneous Multi-device Platform. | Dong Chen, Changqing Xun, Dafei Huang, Mei Wen, Chunyuan Zhang |
| 2013 | HPCC | Device View Redundancy: An Adaptive Low-Overhead Fault Tolerance Mechanism for Many-Core System. | Wentao Jia, Chunyuan Zhang, Jian Fu |
| 2013 | HPCC | Solving the Cardiac Model Using Multi-core CPU and Many Integrated Cores (MIC). | Jing Yang, Jun Chai, Mei Wen, Nan Wu, Chunyuan Zhang |
| 2013 | ICCS | Performance of Sediment Transport Simulations on NVIDIA's Kepler Architecture. | Huayou Su, Nan Wu, Mei Wen, Chunyuan Zhang, Xing Cai |
| 2013 | ICPADS | On the GPU-CPU Performance Portability of OpenCL for 3D Stencil Computations. | Huayou Su, Nan Wu, Mei Wen, Chunyuan Zhang, Xing Cai |
| 2012 | CLUSTER | Using 1000+ GPUs and 10000+ CPUs for Sedimentary Basin Simulations. | Mei Wen, Huayou Su, Wenjie Wei, Nan Wu, Xing Cai, Chunyuan Zhang |
| 2012 | FPGA | The masala machine: accelerating thread-intensive and explicit memory management programs with dynamically reconfigurable FPGAs (abstract only). | Mei Wen, Nan Wu, Qianming Yang, Chunyuan Zhang, Liang Zhao |
| 2012 | FPL | Extending BORPH for shared memory reconfigurable computers. | Changqing Xun, Mei Wen, Nan Wu, Chunyuan Zhang, Hayden Kwok-Hay So |
| 2012 | HPCC | Fully Distributed On-chip Instruction Memory Design for Stream Architecture Based on Field-Divided VLIW Compression. | Yi He, Maolin Guan, Chunyuan Zhang, Tian Tian, Qianming Yang |
| 2012 | ICPADS | A Parallel H.264 Encoder with CUDA: Mapping and Evaluation. | Nan Wu, Mei Wen, Huayou Su, Ju Ren, Chunyuan Zhang |
| 2012 | PDCAT | Improving Performance of GPU Specific OpenCL Program on CPUs. | Qiang Lan, Changqing Xun, Mei Wen, Huayou Su, Lifang Liu, Chunyuan Zhang |
| 2011 | ICIG | A Multilevel Parallel Intra Coding for H.264/AVC Based on CUDA. | Huayou Su, Nan Wu, Chunyuan Zhang, Mei Wen, Ju Ren |
| 2010 | DSD | Software Managed Instruction Scratchpad Memory Optimization in Stream Architecture Based on Hot Code Analysis of Kernels. | Yi He, Ju Ren, Mei Wen, Qianming Yang, Nan Wu, Chunyuan Zhang |
| 2009 | HiPC | Cache streamization for high performance stream processor. | Nan Wu, Mei Wen, Ju Ren, Yi He, Changqing Xun, Wei Wu, Chunyuan Zhang |
| 2009 | VTC | Interference-aware Broadcast Routing and Channel Assignment for Multi-Radio Wireless Mesh Networks. | Li Li, Bin Qin, Chunyuan Zhang |
| 2009 | WCNC | QoS-aware on-demand channel width adaptation protocols for multi-radio ad-hoc networks. | Li Li, Chunyuan Zhang, Yanhua Li |
| 2008 | ASPDAC | Load scheduling: Reducing pressure on distributed register files for free. | Mei Wen, Nan Wu, Maolin Guan, Chunyuan Zhang |
| 2007 | HiPC | FT64: Scientific Computing with Streams. | Mei Wen, Nan Wu, Chunyuan Zhang, Wei Wu, Qianming Yang, Changqing Xun |
| 2007 | HPCC | Efficient Broadcasting in Multi-radio Multi-channel and Multi-hop Wireless Networks Based on Self-pruning. | Li Li, Bin Qin, Chunyuan Zhang, Haiyan Li |
| 2007 | HPCC | Quantification of Cut Sequence Set for Fault Tree Analysis. | Dong Liu, Chunyuan Zhang, Weiyan Xing, Rui Li, Haiyan Li |
| 2007 | ICCS | A Fault-Tolerant Real-Time Scheduling Algorithm in Software Fault-Tolerant Module. | Dong Liu, Weiyan Xing, Rui Li, Chunyuan Zhang, Haiyan Li |
| 2006 | HPCC | A Streaming Implementation of Transform and Quantization in H.264. | Haiyan Li, Chunyuan Zhang, Li Li, Ming Pang |
| 2006 | PDCAT | Prediction-Table Based Fault-Tolerant Real-Time Scheduling Algorithm. | Dong Liu, Chunyuan Zhang, Rui Li |
| 2004 | ISPA | A Case of SCMP with TLS. | Jianzhuang Lu, Chunyuan Zhang, Zhiying Wang, Yun Cheng, Dan Wu |
| 2004 | ISPA | A Parallel Reed-Solomon Decoder on the Imagine Stream Processor. | Mei Wen, Chunyuan Zhang, Nan Wu, Haiyan Li, Li Li |