| 2026 | AAAI | SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization. | Zhixiong Zhao, Fangxin Liu, Junjie Wang, Chenyang Guan, Zongwu Wang, Li Jiang, Haibing Guan |
| 2026 | ASPDAC | When Low-Rank Meets Mixed-Precision: Training-Free Joint Compression for Efficient LLM Inference. | Junjie Wang, Fangxin Liu, Jinqi Zhu, Chenyang Guan, Tao Yang, Li Jiang, Haibing Guan |
| 2026 | ASPDAC | TFLOP: Towards Energy-Efficient LLM Inference An FPGA-Affinity Accelerator with Unified LUT-based OPtimization. | Zongwu Wang, Zhongyi Tang, Fangxin Liu, Chenyang Guan, Li Jiang, Haibing Guan |
| 2026 | ASPLOS | EARTH: An Efficient MoE Accelerator with Entropy-Aware Speculative Prefetch and Result Reuse. | Fangxin Liu, Ning Yang, Jingkui Yang, Zongwu Wang, Chenyang Guan, Yu Feng, Li Jiang, Haibing Guan |
| 2026 | DATE | LaMoS: Enabling Efficient Large Number Modular Multiplication through SRAM-based CiM Acceleration. | Haomin Li, Fangxin Liu, Chenyang Guan, Zongwu Wang, Li Jiang, Haibing Guan |
| 2026 | ISCA | STEP: Adaptive Spatio-Temporal Expert Prefetching for Low-Latency and Memory-Efficient MoE Inference. | Fangxin Liu, Ning Yang, Zongwu Wang, Chenyang Guan, Haomin Li, Yu Feng, Liqiang Lu, Xiang Li, Siran Yang, Jiamang Wang, Lin Qu, Li Jiang, Haibing Guan |
| 2026 | ISCA | Harmonia: A Unified Hierarchical Scheduling Framework for Sparse Matrix Multiplication. | Jingkui Yang, Fangxin Liu, Xin Ju, Ning Yang, Chenyang Guan, Junjie Wang, Zongwu Wang, Mei Wen, Jian Liu, Li Jiang, Haibing Guan |
| 2024 | HPCC | FIAless: Asynchronous Programming for Large-Scale Burst Requests in Serverless Computing. | Chenyang Guan, Junjie Yin, Xiaofeng Wang |