| 2026 | AAAI | CloserToMe: A Unified Framework for Accurate and Transferable Latency Prediction Across Heterogeneous Devices. | Cheng Tang, Guochong Sui, Wenqi Lou, Zihan Wang, Jiayi Tuo, Wenqian Xie, Yinkang Gao, Yixuan Zhu, Lei Gong, Chao Wang, Xuehai Zhou |
| 2026 | FPGA | UDP: A Universal DSP Packing Framework for Low-bitwidth MAC Acceleration on FPGAs. | Jundong Wu, Zhendong Zheng, Lei Gong, Chao Wang, Xuehai Zhou |
| 2026 | WWW | Multi-field Balance-aware Calibration of Predictions in Online Advertising. | Zi-Kang Wang, Lei Gong, Shu-Ting Shi, Lan-Zhe Guo, Muyu Zhang |
| 2026 | SIGIR | HE-DeepFM: An FHE Inference System for CTR Prediction with Efficient FM Interactions. | Qiyue Su, Hang Gu, Zhiguang Wang, Teng Wang, Zhendong Zheng, Qianyu Cheng, Lei Gong, Chao Wang |
| 2025 | CLUSTER | A similarity-aware MOE-based method for optimizing tensor programs across diverse GPUs. | Haowen Hou, Zihan Wang, Yining Song, Lei Gong, Chao Wang, Xi Li, Xuehai Zhou |
| 2025 | CLUSTER | Optimizing the Execution Core for Value Prediction in Superscalar Processors. | Yibo Zhang, Lei Gong, Chao Wang, Xuehai Zhou |
| 2025 | DAC | Late Breaking Results: Source-Aware Adaptive Cache Management for CXL-enabled Disaggregated Memory Sharing. | Qianyu Cheng, Jiajun Ji, Teng Wang, Zihan Wang, Lei Gong, Chao Wang, Xuehai Zhou |
| 2025 | DAC | UniCoS: A Unified Neural and Accelerator Co-Search Framework for CNNs and ViTs. | Wei Fu, Wenqi Lou, Cheng Tang, Hongbing Wen, Yunji Qin, Lei Gong, Chao Wang, Xuehai Zhou |
| 2025 | DAC | Late Breaking Results: A Fast Nearest Neighbor Search Acceleration for 3D Point Cloud. | Jinao Li, Teng Wang, Qianyu Cheng, Zhendong Zheng, Lei Gong, Chao Wang, Xi Li, Xuehai Zhou |
| 2025 | DAC | An Efficient Bit-level Sparse MAC-accelerated Architecture with SW/HW Co-design on FPGA. | Chenming Zhang, Lei Gong, Chao Wang, Xuehai Zhou |
| 2025 | EuroPar | CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGA. | Jiale Dong, Hao Wu, Zihao Wang, Wenqi Lou, Zhendong Zheng, Lei Gong, Chao Wang, Xuehai Zhou |
| 2025 | FCCM | Ph.D. Project: A Novel Compilation-Based Approach for Generating Sparse Tensor Accelerators. | Xingyan Chen, Lei Gong, Chao Wang |
| 2025 | ICDM | Boosting Clinical Outcome Prediction with Context-Aware Feature Imputation and Disentanglement. | Lei Gong, Aidong Zhang, Kishlay Jha |
| 2025 | ICPP | Automated FPGA Accelerator Generation Framework for Transformers with Dataflow Optimization. | Wenqi Lou, Yunji Qin, Zihao Wang, Chao Wang, Lei Gong, Xuehai Zhou |
| 2025 | ISCAS | ResDDQN-FPGA: A Reinforcement Learning Framework for Dynamic and Efficient Control in Resonant DC-DC Converters. | Yutong Chen, Hai Li, Lei Gong, Chao Wang |
| 2025 | ISCAS | UbiMoE: A Ubiquitous Mixture-of-Experts Vision Transformer Accelerator With Hybrid Computation Pattern on FPGA. | Jiale Dong, Wenqi Lou, Zhendong Zheng, Yunji Qin, Lei Gong, Chao Wang, Xuehai Zhou |
| 2025 | RTSS | TSI: A Time-Semantic Instruction Set for Deterministic Data-Flow Execution in Real-Time Embedded Systems. | Yinkang Gao, Bo Zhang, Yixuan Zhu, Lei Gong, Teng Wang, Wenqi Lou, Chao Wang, Xi Li, Xuehai Zhou |
| 2025 | RTSS | Work-in-Progress: A Timing-Anomaly Free Dynamic Scheduling on Heterogeneous Systems. | Yixuan Zhu, Yinkang Gao, Binze Jiang, Xiaohang Gong, Lei Gong, Chao Wang, Xi Li, Xuehai Zhou |
| 2024 | AAAI | SDAC: A Multimodal Synthetic Dataset for Anomaly and Corner Case Detection in Autonomous Driving. | Lei Gong, Yu Zhang, Yingqing Xia, Yanyong Zhang, Jianmin Ji |
| 2024 | CLUSTER | Beyond Training: A Zero-Shot Framework to Neural Architecture and Accelerator Co-Exploration. | Wei Fu, Wenqi Lou, Lei Gong, Chao Wang, Xuehai Zhou |
| 2024 | FIE | Clustering Entity Relationship Diagrams: Enhancing Feedback Quality and Grading Consistency in Large Database Courses. | Sohum Thadani, Andrey Shor, Soohong Ahn, Lei Gong, Abdussalam Alawini, Hisham Benotman |
| 2024 | FPL | SoGraph: A State-Aware Architecture for Out-of-Memory Graph Processing on HBM-Equipped FPGAs. | Qianyu Cheng, Zhendong Zheng, Tianhao Jiang, Cheng Tang, Teng Wang, Lei Gong, Chao Wang, Xuehai Zhou |
| 2024 | FPL | LORA: A Latency-Oriented Recurrent Architecture for GPT Model on Multi-FPGA Platform with Communication Optimization. | Zhendong Zheng, Qianyu Cheng, Teng Wang, Lei Gong, Xianglan Chen, Cheng Tang, Chao Wang, Xuehai Zhou |
| 2024 | FPL | FlexWalker: An Efficient Multi-Objective Design Space Exploration Framework for HLS Design. | Zheyuan Zou, Cheng Tang, Lei Gong, Chao Wang, Xuehai Zhou |
| 2024 | ICCD | AutoSparse: A Source-to-Source Format and Schedule Auto- Tuning Framework for Sparse Tensor Program. | Xiangjun Qu, Lei Gong, Wenqi Lou, Qianyu Cheng, Xianglan Chen, Chao Wang, Xuehai Zhou |
| 2024 | ICCD | UniCoMo: A Unified Learning-Based Cost Model for Tensorized Program Tuning. | Zihan Wang, Lei Gong, Wenqi Lou, Qianyu Cheng, Xianglan Chen, Chao Wang, Xuehai Zhou |
| 2024 | PAKDD | Local Subsequence-Based Distribution for Time Series Clustering. | Lei Gong, Hang Zhang, Zongyou Liu, Kai Ming Ting, Yang Cao, Ye Zhu |
| 2024 | PRICAI | MFNAS: Multi-fidelity Exploration in Neural Architecture Search with Stable Zero-Shot Proxy. | Wei Fu, Wenqi Lou, Yunji Qin, Lei Gong, Chao Wang, Xuehai Zhou |
| 2023 | CCGRID | A flexible dataflow CNN accelerator on FPGA. | Haoran Li, Lei Gong, Chao Wang, Xuehai Zhou |
| 2023 | CCGRID | Sparse-HeteroCL: From Sparse Tensor Algebra to Highly Customized Accelerators on FPGAs. | Jize Pang, Lei Gong, Chao Wang, Xuehai Zhou |
| 2023 | DATE | FastRW: A Dataflow-Efficient and Memory-Aware Accelerator for Graph Random Walk on FPGAs. | Yingxue Gao, Teng Wang, Lei Gong, Chao Wang, Xi Li, Xuehai Zhou |
| 2023 | DATE | NAF: Deeper Network/Accelerator Co-Exploration for Customizing CNNs on FPGA. | Wenqi Lou, Jiaming Qian, Lei Gong, Xuan Wang, Chao Wang, Xuehai Zhou |
| 2023 | FCCM | Enabling Elastic Resource Management in Cloud FPGAs via A Multi-layer Collaborative Approach. | Wenbin Teng, Lei Gong, Chao Wang, Xuehai Zhou |
| 2023 | FCCM | DataMaster: A GNN-based Data Type Optimizer for Dataflow Design in FPGA. | Zheyuan Zou, Lei Gong, Chao Wang, Xuehai Zhou |
| 2023 | FPGA | hAP: A Spatial-von Neumann Heterogeneous Automata Processor with Optimized Resource and IO Overhead on FPGA. | Xuan Wang, Lei Gong, Jing Cao, Wenqi Lou, Weiya Wang, Chao Wang, Xuehai Zhou |
| 2022 | FPL | SDMA: An Efficient and Flexible Sparse-Dense Matrix-Multiplication Architecture for GNNs. | Yingxue Gao, Lei Gong, Chao Wang, Teng Wang, Xuehai Zhou |
| 2022 | IJCAI | Attributed Graph Clustering with Dual Redundancy Reduction. | Lei Gong, Sihang Zhou, Wenxuan Tu, Xinwang Liu |
| 2022 | ISPA | WGeod: A General and Efficient FPGA Accelerator for Object Detection. | Zihan Wang, Mengying Zhao, Lei Gong, Chao Wang |
| 2022 | NPC | Multi-clusters: An Efficient Design Paradigm of NN Accelerator Architecture Based on FPGA. | Teng Wang, Lei Gong, Chao Wang, Yang Yang, Yingxue Gao |
| 2021 | DATE | LAP: A Lightweight Automata Processor for Pattern Matching Tasks. | Haojun Xia, Lei Gong, Chao Wang, Xianglan Chen, Xuehai Zhou |
| 2021 | ICCD | UH-JLS: A Parallel Ultra-High Throughput JPEG-LS Encoding Architecture for Lossless Image Compression. | Xuan Wang, Lei Gong, Chao Wang, Xi Li, Xuehai Zhou |
| 2021 | ISPA | Vapor: A GPU Sharing Scheduler with Communication and Computation Pipeline for Distributed Deep Learning. | Xiaorui Zhu, Lei Gong, Zongwei Zhu, Xuehai Zhou |
| 2020 | CLUSTER | OctCNN: An Energy-Efficient FPGA Accelerator for CNNs using Octave Convolution Algorithm. | Wenqi Lou, Chao Wang, Lei Gong, Xuehai Zhou |
| 2020 | FPGA | ConvCloud: An Adaptive Convolutional Neural Network Accelerator on Cloud FPGAs. | Yang Yang, Chao Wang, Lei Gong, Xuehai Zhou |
| 2020 | HPCC | Chameleon: Image Style Transfer Based on Image Classification Networks. | Haobo Li, Ratan Dey, Lei Gong, Chao Wang |
| 2019 | CLUSTER | Design Exploration of Multi-FPGAs for Accelerating Deep Learning. | Teng Wang, Lei Gong, Chao Wang, Xuehai Zhou, Huaping Chen |
| 2018 | FPGA | Domino: An Asynchronous and Energy-efficient Accelerator for Graph Processing: (Abstract Only). | Chongchong Xu, Chao Wang, Yiwei Zhang, Lei Gong, Xi Li, Xuehai Zhou |
| 2018 | ICWS | Domino: Graph Processing Services on Energy-Efficient Hardware Accelerator. | Chongchong Xu, Chao Wang, Lei Gong, Lihui Jin, Xi Li, Xuehai Zhou |
| 2017 | CASES | A high-performance FPGA accelerator for sparse neural networks: work-in-progress. | Yuntao Lu, Lei Gong, Chongchong Xu, Fan Sun, Yiwei Zhang, Chao Wang, Xuehai Zhou |
| 2017 | CLUSTER | A Power-Efficient Accelerator for Convolutional Neural Networks. | Fan Sun, Chao Wang, Lei Gong, Chongchong Xu, Yiwei Zhang, Yuntao Lu, Xi Li, Xuehai Zhou |
| 2017 | CLUSTER | OmniGraph: A Scalable Hardware Accelerator for Graph Processing. | Chongchong Xu, Chao Wang, Lei Gong, Yuntao Lu, Fan Sun, Yiwei Zhang, Xi Li, Xuehai Zhou |
| 2017 | CLUSTER | A Power-Efficient Accelerator Based on FPGAs for LSTM Network. | Yiwei Zhang, Chao Wang, Lei Gong, Yuntao Lu, Fan Sun, Chongchong Xu, Xi Li, Xuehai Zhou |
| 2017 | ICWS | GenServ: Genome Sequencing Services on Scalable Energy Efficient Accelerators. | Chao Wang, Haijie Fang, Shiming Lei, Lei Gong, Aili Wang, Xi Li, Xuehai Zhou |
| 2017 | ICWS | xFilter: A Temporal Locality Accelerator for Intrusion Detection System Services. | Chao Wang, Jinhong Zhou, Lei Gong, Xi Li, Aili Wang, Xuehai Zhou |
| 2017 | ICWS | Evaluation and Trade-offs of Graph Processing for Cloud Services. | Chongchong Xu, Jinhong Zhou, Yuntao Lu, Fan Sun, Lei Gong, Chao Wang, Xi Li, Xuehai Zhou |
| 2017 | ISPA | A High-Performance Accelerator for Large-Scale Convolutional Neural Networks. | Fan Sun, Chao Wang, Lei Gong, Chongchong Xu, Yiwei Zhang, Yuntao Lu, Xi Li, Xuehai Zhou |
| 2017 | ISPA | Implementation and Optimization of the Accelerator Based on FPGA Hardware for LSTM Network. | Yiwei Zhang, Chao Wang, Lei Gong, Yuntao Lu, Fan Sun, Chongchong Xu, Xi Li, Xuehai Zhou |
| 2008 | ICPADS | Link Availability Prediction in Ad Hoc Networks. | Lei Gong, Yuebin Bai, Ming Chen, Depei Qian |