Skip to content

Guohao Dai

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

88

Venues

28

Active years

2013–2026

Best venue rank

A*

Where they publish

Papers

88 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAIMoSs: Mixture of Scales for Efficient High-Resolution Autoregressive Image Generation.Yaoxiu Lian, Hao Liang, Zhihong Gou, Yijia Zhang, Jiaming Xu, Guohao Dai, Ningyi Xu
2026AAAISpecDiff: Accelerating Diffusion Model Inference with Self-Speculation.Jiayi Pan, Jiaming Xu, Yongkang Zhou, Guohao Dai
2026ACLVocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models.Hanling Zhang, Yayu Zhou, Tongcheng Fang, Zhihang Yuan, Guohao Dai, Wanli Ouyang, Yu Wang
2026ASPDACBalanceGS: Algorithm-System Co-design for Efficient 3D Gaussian Splatting Training on GPU.Junyi Wu, Jiaming Xu, Jinhao Li, Yongkang Zhou, Jiayi Pan, Xingyang Li, Guohao Dai
2026ASPDACSpAct-NDP: Efficient LLM Inference via Sparse Activation on NDP-GPU Heterogeneous Architecture.Jiaming Xu, Tongxin Xie, Yongkang Zhou, Jinhao Li, Yaoxiu Lian, Zhenhua Zhu, Yu Wang, Guohao Dai
2026ASPLOSUntitled recordJiaming Xu, Jiayi Pan, Hanzhen Wang, Yongkang Zhou, Jiancai Ye, Yu Wang, Guohao Dai
2026DATEFAST: A Scalable Framework for Accelerating Flexible Structured Sparse Training.Shuaiheng Li, Jun Liu, Xinhao Li, Yaoxiu Lian, Tianlang Zhao, Li Ding, Guohao Dai
2026DATEEndor: Exploit Nearly-Decode-Only Opportunities of LLM Reasoning on Near-Memory Architecture.Jun Liu, Tianlang Zhao, Shiyi Liu, Jiancai Ye, Lin Li, Zhen Yu, Li Ding, Hao Zhou, Zhenhua Zhu, Xuefei Ning, Yuan Xie, Yu Wang, Guohao Dai
2026DATESuperPhys-Net: A Physics-Informed Super-Resolution Electromagnetic Simulator for Nanophotonic Devices.Yiyang Su, Hao Chen, Guohao Dai, Yuzhe Ma, Yeyu Tong
2026EuroSysEfficient and Adaptable Overlapping for Computation and Communication via Signaling and Reordering.Ke Hong, Xiuhong Li, Minxu Liu, Qiuli Mao, Tianqi Wu, Zixiao Huang, Lufang Chen, Zhong Wang, Yichong Zhang, Zhenhua Zhu, Guohao Dai, Yu Wang
2026EuroSysSTAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning.Zixiao Huang, Junhao Hu, Hao Lin, Chunyang Zhu, Yueran Tang, Quanlu Zhang, Zhen Guo, Zhenhua Li, Shengen Yan, Zhenhua Zhu, Guohao Dai, Yu Wang
2025ASPDACViDA: Video Diffusion Transformer Acceleration with Differential Approximation and Adaptive Dataflow.Li Ding, Jun Liu, Shan Huang, Guohao Dai
2025ASPDACLLSM: LLM-enhanced Logic Synthesis Model with EDA-guided CoT Prompting, Hybrid Embedding and AIG-tailored Acceleration.Shan Huang, Jinhao Li, Zhen Yu, Jiancai Ye, Jiaming Xu, Ningyi Xu, Guohao Dai
2025ASPDACAccelerator for LLM-Enhanced GNN with Product Quantization and Unified Indexing.Jiaming Xu, Jinhao Li, Jun Liu, Hao Zhou, Guohao Dai
2025ASPDACDeploying Diffusion Models with Scheduling Space Search and Memory Overflow Prevention Based on Graph Optimization.Hao Zhou, Yang Liu, Hongji Wang, Enhao Tang, Shun Li, Yifan Zhang, Guohao Dai, Yongpan Liu, Kun Wang
2025CIKMSG-Filter: Enhancing Similar Text Retrieval via Hierarchical Summarized-Semantic Index and Adaptive Filtering.Jiancai Ye, Jun Liu, Haoyu Zhang, Maojia Sheng, Tao Yang, Jiaming Xu, Jinhao Li, Yu Wang, Guohao Dai
2025CVPRMBQ: Modality-Balanced Quantization for Large Vision-Language Models.Shiyao Li, Yingchun Hu, Xuefei Ning, Xihui Liu, Ke Hong, Xiaotao Jia, Xiuhong Li, Yaqi Yan, Pei Ran, Guohao Dai, Shengen Yan, Huazhong Yang, Yu Wang
2025DACA Cross-model Fusion-aware Framework for Optimizing (gather-matmul-scatter)s Workload.Yaoxiu Lian, Zhihong Gou, Yibo Han, Zhongming Yu, Jiaming Xu, Sheng Yuan, Zhilin Pei, Xingcheng Zhang, Ningyi Xu, Guohao Dai
2025DACHarnessing Conventional Video Processing Insights for Emerging 3D Video Generation Models: A Comprehensive Attention-aware Way.Tianlang Zhao, Jun Liu, Xingyang Li, Li Ding, Jinhao Li, Shuaiheng Li, Jinbo Hu, Guohao Dai
2025DATESoftmAP: Software-Hardware Co-Design for Integer-Only Softmax on Associative Processors.Mariam Rakka, Jinhao Li, Guohao Dai, Ahmed M. Eltawil, Mohammed E. Fouda, Fadi J. Kurdahi
2025DATEAiSpGEMM: Accelerating Imbalanced SpGEMM on FPGAs with Flexible Interconnect and Intra-row Parallel Merging.Enhao Tang, Shun Li, Hao Zhou, Guohao Dai, Jun Lin, Kun Wang
2025DATEDyLGNN: Efficient LM-GNN Fine-Tuning with Dynamic Node Partitioning, Low-Degree Sparsity, and Asynchronous Sub-Batch.Zhen Yu, Jinhao Li, Jiaming Xu, Shan Huang, Jiancai Ye, Ningyi Xu, Guohao Dai
2025EMNLPEfficient Inference for Large Language Models -Algorithm, Model, and System.Xuefei Ning, Guohao Dai, Haoli Bai, Lu Hou, Yu Wang, Qun Liu
2025FPGAFlightVGM: Efficient Video Generation Model Inference with Online Sparsification and Hybrid Precision on FPGAs.Jun Liu, Shulin Zeng, Li Ding, Widyadewi Soedarmadji, Hao Zhou, Zehao Wang, Jinhao Li, Jintao Li, Yadong Dai, Kairui Wen, Shan He, Yaqi Sun, Yu Wang, Guohao Dai
2025FPGAFMC-LLM: Enabling FPGAs for Efficient Batched Decoding of 70B+ LLMs with a Memory-Centric Streaming Architecture.Wenheng Ma, Xinhao Yang, Shulin Zeng, Tengxuan Liu, Libo Shen, Hongyi Wang, Shiyao Li, Jiewen Wang, Yuhan Zhang, Hao Guo, Jintao Li, Ziming Zhang, Zhenhua Zhu, Xuefei Ning, Tsung-Yi Ho, Guohao Dai, Yu Wang
2025HPCATB-STC: Transposable Block-wise N: M Structured Sparse Tensor Core.Jun Liu, Shulin Zeng, Junbo Zhao, Li Ding, Zeyu Wang, Jinhao Li, Zhenhua Zhu, Xuefei Ning, Chen Zhang, Yu Wang, Guohao Dai
2025ICCVFrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models.Tianyu Fu, Tengxuan Liu, Qinghao Han, Guohao Dai, Shengen Yan, Huazhong Yang, Xuefei Ning, Yu Wang
2025ICCVDlfr-Gen: Diffusion-Based Video Generation With Dynamic Latent Frame Rate.Zhihang Yuan, Rui Xie, Yuzhang Shang, Hanling Zhang, Siyuan Wang, Shengen Yan, Guohao Dai, Yu Wang
2025ICCVDiTFastAttnV2: Head-Wise Attention Compression for Multi-Modality Diffusion Transformers.Hanling Zhang, Rundong Su, Zhihang Yuan, Pengtao Chen, Mingzhu Shen, Yibo Fan, Shengen Yan, Guohao Dai, Yu Wang
2025ICLRLinear Combination of Saved Checkpoints Makes Consistency and Diffusion Models Better.Enshu Liu, Junyi Zhu, Zinan Lin, Xuefei Ning, Shuaiqi Wang, Matthew B. Blaschko, Sergey Yekhanin, Shengen Yan, Guohao Dai, Huazhong Yang, Yu Wang
2025ICLRAccelerating Auto-regressive Text-to-Image Generation with Training-free Speculative Jacobi Decoding.Yao Teng, Han Shi, Xian Liu, Xuefei Ning, Guohao Dai, Yu Wang, Zhenguo Li, Xihui Liu
2025ICLRViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation.Tianchen Zhao, Tongcheng Fang, Haofeng Huang, Rui Wan, Widyadewi Soedarmadji, Enshu Liu, Shiyao Li, Zinan Lin, Guohao Dai, Shengen Yan, Huazhong Yang, Xuefei Ning, Yu Wang
2025ICLRDeepGate4: Efficient and Effective Representation Learning for Circuit Design at Scale.Ziyang Zheng, Shan Huang, Jianyuan Zhong, Zhengyuan Shi, Guohao Dai, Ningyi Xu, Qiang Xu
2025ISCASpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting.Jiaming Xu, Jiayi Pan, Yongkang Zhou, Siming Chen, Jinhao Li, Yaoxiu Lian, Junyi Wu, Guohao Dai
2024ASPLOSFEASTA: A Flexible and Efficient Accelerator for Sparse Tensor Algebra in Machine Learning.Kai Zhong, Zhenhua Zhu, Guohao Dai, Hongyi Wang, Xinhao Yang, Haoyu Zhang, Jin Si, Qiuli Mao, Shulin Zeng, Ke Hong, Genghan Zhang, Huazhong Yang, Yu Wang
2024CVPRFlashEval: Towards Fast and Accurate Evaluation of Text-to-Image Diffusion Generative Models.Lin Zhao, Tianchen Zhao, Zinan Lin, Xuefei Ning, Guohao Dai, Huazhong Yang, Yu Wang
2024DACDySpMM: From Fix to Dynamic for Sparse Matrix-Matrix Multiplication Accelerators.Hongyi Wang, Kai Zhong, Haoyu Zhang, Shulin Zeng, Zhenhua Zhu, Xinhao Yang, Shuang Wang, Guohao Dai, Huazhong Yang, Yu Wang
2024DATEFusionArch: A Fusion-Based Accelerator for Point-Based Point Cloud Neural Networks.Xueyuan Liu, Zhuoran Song, Guohao Dai, Gang Li, Can Xiao, Yan Xiang, Dehui Kong, Ke Xu, Xiaoyao Liang
2024DATEDyPIM: Dynamic-Inference-Enabled Processing - In-Memory Accelerator.Tongxin Xie, Tianchen Zhao, Zhenhua Zhu, Xuefei Ning, Bing Li, Guohao Dai, Huazhong Yang, Yu Wang
2024ECCVMixDQ: Memory-Efficient Few-Step Text-to-Image Diffusion Models with Metric-Decoupled Mixed Precision Quantization.Tianchen Zhao, Xuefei Ning, Tongcheng Fang, Enshu Liu, Guyue Huang, Zinan Lin, Shengen Yan, Guohao Dai, Yu Wang
2024FPGAFlightLLM: Efficient Large Language Model Inference with a Complete Mapping Flow on FPGAs.Shulin Zeng, Jun Liu, Guohao Dai, Xinhao Yang, Tianyu Fu, Hongyi Wang, Wenheng Ma, Hanbo Sun, Shiyao Li, Zixiao Huang, Yadong Dai, Jintao Li, Zehao Wang, Ruoyu Zhang, Kairui Wen, Xuefei Ning, Yu Wang
2024ICCADMARCA: Mamba Accelerator with Reconfigurable Architecture.Jinhao Li, Shan Huang, Jiaming Xu, Jun Liu, Li Ding, Ningyi Xu, Guohao Dai
2024ICCADFast and Efficient 2-bit LLM Inference on GPU: 2/4/16-bit in a Weight Matrix with Asynchronous Dequantization.Jinhao Li, Jiaming Xu, Shiyao Li, Shan Huang, Jun Liu, Yaoxiu Lian, Guohao Dai
2024ICCADTowards Floating Point-Based Attention-Free LLM: Hybrid PIM with Non-Uniform Data Format and Reduced Multiplications.Lidong Guo, Zhenhua Zhu, Tengxuan Liu, Xuefei Ning, Shiyao Li, Guohao Dai, Huazhong Yang, Wangyang Fu, Yu Wang
2024ICMLEvaluating Quantized Large Language Models.Shiyao Li, Xuefei Ning, Luning Wang, Tengxuan Liu, Xiangsheng Shi, Shengen Yan, Guohao Dai, Huazhong Yang, Yu Wang
2023ASPDACNTGAT: A Graph Attention Network Accelerator with Runtime Node Tailoring.Wentao Hou, Kai Zhong, Shulin Zeng, Guohao Dai, Huazhong Yang, Yu Wang
2023ASPDACHigh-Dimensional Yield Estimation Using Shrinkage Deep Features and Maximization of Integral Entropy Reduction.Shuo Yin, Guohao Dai, Wei W. Xing
2023CVPRTorchSparse++: Efficient Point Cloud Engine.Haotian Tang, Shang Yang, Zhijian Liu, Ke Hong, Zhongming Yu, Xiuyu Li, Guohao Dai, Yu Wang, Song Han
2023DACSeeking the Yield Barrier: High-Dimensional SRAM Evaluation Through Optimal Manifold.Yanfang Liu, Guohao Dai, Wei W. Xing
2023DACMemory-Efficient and Real-Time SPAD-based dToF Depth Sensor with Spatial and Statistical Correlation.Shiyao Li, Zhenhua Zhu, Yu Zhu, Qingpeng Zhu, Jiangwei Zhang, Wenxiu Sun, Guohao Dai, Fei Qiao, Huazhong Yang, Yu Wang
2023DACAn Efficient Accelerator for Point-based and Voxel-based Point Cloud Neural Networks.Xinhao Yang, Tianyu Fu, Guohao Dai, Shulin Zeng, Kai Zhong, Ke Hong, Yu Wang
2023DACProcessing-In-Hierarchical-Memory Architecture for Billion-Scale Approximate Nearest Neighbor Search.Zhenhua Zhu, Jun Liu, Guohao Dai, Shulin Zeng, Bing Li, Huazhong Yang, Yu Wang
2023DACPIM-HLS: An Automatic Hardware Generation Tool for Heterogeneous Processing-In-Memory-based Neural Network Accelerators.Yu Zhu, Zhenhua Zhu, Guohao Dai, Fengbin Tu, Hanbo Sun, Kwang-Ting Cheng, Huazhong Yang, Yu Wang
2023DATECLAP: Locality Aware and Parallel Triangle Counting with Content Addressable Memory.Tianyu Fu, Chiyue Wei, Zhenhua Zhu, Shang Yang, Zhongming Yu, Guohao Dai, Huazhong Yang, Yu Wang
2023DATEMinimizing Communication Conflicts in Network-On-Chip Based Processing-In-Memory Architecture.Hanbo Sun, Tongxin Xie, Zhenhua Zhu, Guohao Dai, Huazhong Yang, Yu Wang
2023ECAIAdam Accumulation to Reduce Memory Footprints of Both Activations and Gradients for Large-Scale DNN Training.Yijia Zhang, Yibo Han, Shijie Cao, Guohao Dai, Youshan Miao, Ting Cao, Fan Yang, Ningyi Xu
2023ICCADA Point Transformer Accelerator with Fine-Grained Pipelines and Distribution-Aware Dynamic FPS.Yaoxiu Lian, Xinhao Yang, Ke Hong, Yu Wang, Guohao Dai, Ningyi Xu
2023ICCADOPT: Optimal Proposal Transfer for Efficient Yield Optimization for Analog and SRAM Circuits.Yanfang Liu, Guohao Dai, Yuanqing Cheng, Wang Kang, Wei W. Xing
2023ICCADTSTC: Two-Level Sparsity Tensor Core Enabling both Algorithm Flexibility and Hardware Efficiency.Jun Liu, Guohao Dai, Hao Xia, Lidong Guo, Xiangsheng Shi, Jiaming Xu, Huazhong Yang, Yu Wang
2023ICCVAda3D : Exploiting the Spatial Redundancy with Adaptive Inference for Efficient 3D Object Detection.Tianchen Zhao, Xuefei Ning, Ke Hong, Zhongyuan Qiu, Pu Lu, Yali Zhao, Linfeng Zhang, Lipu Zhou, Guohao Dai, Huazhong Yang, Yu Wang
2023MICROTorchSparse++: Efficient Training and Inference Framework for Sparse Convolution on GPUs.Haotian Tang, Shang Yang, Zhijian Liu, Ke Hong, Zhongming Yu, Xiuyu Li, Guohao Dai, Yu Wang, Song Han
2023MICRODF-GAS: a Distributed FPGA-as-a-Service Architecture towards Billion-Scale Graph-based Approximate Nearest Neighbor Search.Shulin Zeng, Zhenhua Zhu, Jun Liu, Haoyu Zhang, Guohao Dai, Zixuan Zhou, Shuangchen Li, Xuefei Ning, Yuan Xie, Huazhong Yang, Yu Wang
2023WWWCogDL: A Comprehensive Library for Graph Deep Learning.Yukuo Cen, Zhenyu Hou, Yan Wang, Qibin Chen, Yizhen Luo, Zhongming Yu, Hengrui Zhang, Xingcheng Yao, Aohan Zeng, Shiguang Guo, Yuxiao Dong, Yang Yang, Peng Zhang, Guohao Dai, Yu Wang, Chang Zhou, Hongxia Yang, Jie Tang
2022ASPLOSA one-for-all andBangyan Wang, Lei Deng, Fei Sun, Guohao Dai, Liu Liu, Yu Wang, Yuan Xie
2022DACHeuristic adaptability to input dynamics for SpMM on CPUs.Guohao Dai, Guyue Huang, Shang Yang, Zhongming Yu, Hengrui Zhang, Yufei Ding, Yuan Xie, Huazhong Yang, Yu Wang
2022DATEGibbon: Efficient Co-Exploration of NN Model and Processing-In-Memory Architecture.Hanbo Sun, Chenyu Wang, Zhenhua Zhu, Xuefei Ning, Guohao Dai, Huazhong Yang, Yu Wang
2022DATEExploiting Parallelism with Vertex-Clustering in Processing-In-Memory-based GCN Accelerators.Yu Zhu, Zhenhua Zhu, Guohao Dai, Kai Zhong, Huazhong Yang, Yu Wang
2022ISCADIMMining: pruning-efficient and parallel graph mining on near-memory-computing.Guohao Dai, Zhenhua Zhu, Tianyu Fu, Chiyue Wei, Bangyan Wang, Xiangyu Li, Yuan Xie, Huazhong Yang, Yu Wang
2022MDMOptimizing Graph-based Approximate Nearest Neighbor Search: Stronger and Smarter.Jun Liu, Zhenhua Zhu, Jingbo Hu, Hanbo Sun, Li Liu, Lingzhi Liu, Guohao Dai, Huazhong Yang, Yu Wang
2021FPGA3M-AI: A Multi-task and Multi-core Virtualization Framework for Multi-FPGA AI Systems in the Cloud.Shulin Zeng, Guohao Dai, Hanbo Sun, Jun Liu, Hongren Zheng, Yusong Wu, Fan Zhang, Xinhao Yang, Yi Cai, Yu Wang, Huazhong Yang
2021ICCADRerec: In-ReRAM Acceleration with Access-Aware Mapping for Personalized Recommendation.Yitu Wang, Zhenhua Zhu, Fan Chen, Mingyuan Ma, Guohao Dai, Yu Wang, Hai Li, Yiran Chen
2021ICCDExploiting Online Locality and Reduction Parallelism for Sampled Dense Matrix Multiplication on GPUs.Zhongming Yu, Guohao Dai, Guyue Huang, Yu Wang, Huazhong Yang
2020DACINCA: INterruptible CNN Accelerator for Multi-tasking in Embedded Robots.Jincheng Yu, Zhilin Xu, Shulin Zeng, Chao Yu, Jiantao Qiu, Chaoyang Shen, Yuanfan Xu, Guohao Dai, Yu Wang, Huazhong Yang
2020FCCMEnabling Efficient and Flexible FPGA Virtualization for Deep Learning in the Cloud.Shulin Zeng, Guohao Dai, Hanbo Sun, Kai Zhong, Guangjun Ge, Kaiyuan Guo, Yu Wang, Huazhong Yang
2020FPGAINCAME: INterruptible CNN Accelerator for Multi-robot Exploration.Jincheng Yu, Zhilin Xu, Shulin Zeng, Chao Yu, Jiantao Qiu, Chaoyang Shen, Yuanfan Xu, Guohao Dai, Yu Wang, Huazhong Yang
2020FPGAEnable Efficient and Flexible FPGA Virtualization for Deep Learning in the Cloud.Shulin Zeng, Guohao Dai, Kai Zhong, Hanbo Sun, Guangjun Ge, Kaiyuan Guo, Yu Wang, Huazhong Yang
2020SCGE-SpMM: general-purpose sparse matrix-matrix multiplication on GPUs for graph neural networks.Guyue Huang, Guohao Dai, Yu Wang, Huazhong Yang
2019ASPDACGraphSAR: a sparsity-aware processing-in-memory architecture for large-scale graph processing on ReRAMs.Guohao Dai, Tianhao Huang, Yu Wang, Huazhong Yang, John Wawrzynek
2019DACMemory-Bound Proof-of-Work Acceleration for Blockchain Applications.Kun Wu, Guohao Dai, Xing Hu, Shuangchen Li, Xinfeng Xie, Yu Wang, Yuan Xie
2019DACA Configurable Multi-Precision CNN Computing Framework Based on Single Bit RRAM.Zhenhua Zhu, Hanbo Sun, Yujun Lin, Guohao Dai, Lixue Xia, Song Han, Yu Wang, Huazhong Yang
2019ICCADCentrifuge: Evaluating full-system HLS-generated heterogenous-accelerator SoCs using FPGA-Acceleration.Qijing Huang, Christopher Yarp, Sagar Karandikar, Nathan Pemberton, Benjamin Brock, Liang Ma, Guohao Dai, Robert Quitt, Krste Asanovic, John Wawrzynek
2018DATEHyVE: Hybrid vertex-edge memory hierarchy for energy-efficient graph processing.Tianhao Huang, Guohao Dai, Yu Wang, Huazhong Yang
2018FCCMNewGraph: Balanced Large-Scale Graph Processing on FPGAs with Low Preprocessing Overheads.Guohao Dai, Tianhao Huang, Yu Wang, Huazhong Yang, John Wawrzynek
2017FPGAForeGraph: Exploring Large-scale Graph Processing on Multi-FPGA Architecture.Guohao Dai, Tianhao Huang, Yuze Chi, Ningyi Xu, Yu Wang, Huazhong Yang
2016FPGAFPGP: Graph Processing Framework on FPGA A Case Study of Breadth-First Search.Guohao Dai, Yuze Chi, Yu Wang, Huazhong Yang
2016FPLApproximate Frequent Itemset Mining for streaming data on FPGA.Yubin Li, Yuliang Sun, Guohao Dai, Qiang Xu, Yu Wang, Huazhong Yang
2016ICDENXgraph: An efficient graph processing system on a single machine.Yuze Chi, Guohao Dai, Yu Wang, Guangyu Sun, Guoliang Li, Huazhong Yang
2013HPCCDTW-Based Subsequence Similarity Search on AMD Heterogeneous Computing Platform.Sitao Huang, Guohao Dai, Yuliang Sun, Zilong Wang, Yu Wang, Huazhong Yang