| 2024 | DAC | PT-Map: Efficient Program Transformation Optimization for CGRA Mapping. | Bizhao Shi, Tuo Dai, Jiaxi Zhang, Xuechao Wei, Guojie Luo |
| 2024 | ICS | RadiK: Scalable and Optimized GPU-Parallel Radix Top-K Selection. | Yifei Li, Bole Zhou, Jiejing Zhang, Xuechao Wei, Yinghan Li, Yingda Chen |
| 2024 | PPoPP | POSTER: RadiK: Scalable Radix Top-K Selection on GPUs. | Yifei Li, Bole Zhou, Jiejing Zhang, Xuechao Wei, Yinghan Li, Yingda Chen |
| 2023 | ICCAD | Klotski: DNN Model Orchestration Framework for Dataflow Architecture Accelerators. | Chen Bai, Xuechao Wei, Youwei Zhuo, Yi Cai, Hongzhong Zheng, Bei Yu, Yuan Xie |
| 2023 | MICRO | ArchExplorer: Microarchitecture Exploration Via Bottleneck Analysis. | Chen Bai, Jiayi Huang, Xuechao Wei, Yuzhe Ma, Sicheng Li, Hongzhong Zheng, Bei Yu, Yuan Xie |
| 2022 | ICCAD | 2022 ICCAD CAD Contest Problem C: Microarchitecture Design Space Exploration. | Sicheng Li, Chen Bai, Xuechao Wei, Bizhao Shi, Yen-Kuang Chen, Yuan Xie |
| 2022 | USENIX | PetS: A Unified Framework for Parameter-Efficient Transformers Serving. | Zhe Zhou, Xuechao Wei, Jiejing Zhang, Guangyu Sun |
| 2020 | DAC | FTDL: A Tailored FPGA-Overlay for Deep Learning with High Scalability. | Runbin Shi, Yuhao Ding, Xuechao Wei, He Li, Hang Liu, Hayden Kwok-Hay So, Caiwen Ding |
| 2020 | FPGA | FTDL: An FPGA-tailored Architecture for Deep Learning Systems. | Runbin Shi, Yuhao Ding, Xuechao Wei, Hang Liu, Hayden Kwok-Hay So, Caiwen Ding |
| 2019 | DAC | Overcoming Data Transfer Bottlenecks in FPGA-based DNN Accelerators via Layer Conscious Memory Management. | Xuechao Wei, Yun Liang, Jason Cong |
| 2019 | FPGA | Overcoming Data Transfer Bottlenecks in DNN Accelerators via Layer-Conscious Memory Managment. | Xuechao Wei, Yun Liang, Peng Zhang, Cody Hao Yu, Jason Cong |
| 2019 | ISCAS | Frequency Improvement of Systolic Array-Based CNNs on FPGAs. | Jiaxi Zhang, Wentai Zhang, Guojie Luo, Xuechao Wei, Yun Liang, Jason Cong |
| 2018 | ICCAD | TGPA: tile-grained pipeline architecture for low latency CNN inference. | Xuechao Wei, Yun Liang, Xiuhong Li, Cody Hao Yu, Peng Zhang, Jason Cong |
| 2017 | ASPDAC | Throughput optimization for streaming applications on CPU-FPGA heterogeneous systems. | Xuechao Wei, Yun Liang, Tao Wang, Songwu Lu, Jason Cong |
| 2017 | DAC | Automated Systolic Array Architecture Synthesis for High Throughput CNN Inference on FPGAs. | Xuechao Wei, Cody Hao Yu, Peng Zhang, Youxiang Chen, Yuxin Wang, Han Hu, Yun Liang, Jason Cong |
| 2012 | ICS | Distributed replay protocol for distributed uniprocessors. | Mengjie Mao, Hong An, Bobin Deng, Tao Sun, Xuechao Wei, Wei Zhou, Wenting Han |
| 2012 | PPoPP | FlexBFS: a parallelism-aware implementation of breadth-first search on GPU. | Gu Liu, Hong An, Wenting Han, Xiaoqiang Li, Tao Sun, Wei Zhou, Xuechao Wei, Xulong Tang |