Skip to content

Weihao Cui

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

21

Venues

12

Active years

2019–2026

Best venue rank

A*

Where they publish

Papers

21 indexed papers, newest first.

YearVenueTitleAuthors
2026ASPLOSTowards High-Goodput LLM Serving with Prefill-decode Multiplexing.Yukang Chen, Weihao Cui, Han Zhao, Ziyi Xu, Xiaoze Fan, Xusheng Chen, Yangjie Zhou, Shixuan Sun, Bingsheng He, Quan Chen
2026EuroSysArena: Efficiently Training Large Models via Dynamic Scheduling and Adaptive Parallelism Co-Design.Chunyu Xue, Weihao Cui, Quan Chen, Chen Chen, Han Zhao, Shulai Zhang, Linmei Wang, Yan Li, Limin Xiao, Weifeng Zhang, Jing Yang, Bingsheng He, Minyi Guo
2026HPCALEGO: Supporting LLM-Enhanced Games with One Gaming GPU.Han Zhao, Weihao Cui, Zeshen Zhang, Wenhao Zhang, Jiangtong Li, Quan Chen, Pu Pang, Zijun Li, Zhenhua Han, Yuqing Yang, Minyi Guo
2026NSDIFLARE: Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale.Weihao Cui, Ji Zhang, Han Zhao, Chao Liu, Jian Sha, Bo Sang, Bingsheng He, Minyi Guo, Quan Chen
2026NSDIMuxTune: Efficient Multi-Task LLM Fine-Tuning in Multi-Tenant Datacenters via Spatial-Temporal Backbone Multiplexing.Chunyu Xue, Yi Pan, Weihao Cui, Quan Chen, Shulai Zhang, Bingsheng He, Minyi Guo
2025ASPLOSVoyager: Input-Adaptive Algebraic Transformations for High-Performance Graph Neural Networks.Yangjie Zhou, Wenting Shen, Jingwen Leng, Shuwen Lu, Zihan Liu, Weihao Cui, Zhendong Zhang, Wencong Xiao, Baole Ai, Yong Li, Wei Lin, Deze Zeng, Yun Liang, Quan Chen, Ning Liu, Minyi Guo
2025EuroSysImproving GPU Sharing Performance through Adaptive Bubbleless Spatial-Temporal Sharing.Shulai Zhang, Quan Chen, Weihao Cui, Han Zhao, Chunyu Xue, Zhen Zheng, Wei Lin, Minyi Guo
2025HPCAVQ-LLM: High-performance Code Generation for Vector Quantization Augmented LLM Inference.Zihan Liu, Xinhao Luo, Junxian Guo, Wentao Ni, Yangjie Zhou, Yue Guan, Cong Guo, Weihao Cui, Yu Feng, Minyi Guo, Yuhao Zhu, Minjia Zhang, Chen Jin, Jingwen Leng
2025SCA Sample-Free Compilation Framework for Efficient Dynamic Tensor Computation.Yangjie Zhou, Honglin Zhu, Qian Qiu, Weihao Cui, Zihan Liu, Peng Chen, Mohamed Wahib, Cong Guo, Siyuan Feng, Jintao Meng, Haidong Lan, Jingwen Leng, Yun Lin, Jin Song Dong, Wenxi Zhu, Minwen Deng
2025USENIXEfficient Performance-Aware GPU Sharing with Compatibility and Isolation through Kernel Space Interception.Shulai Zhang, Ao Xu, Quan Chen, Han Zhao, Weihao Cui, Zhen Wang, Yan Li, Limin Xiao, Minyi Guo
2023CLOUDMaximizing the Utilization of GPUs Used by Cloud Gaming through Adaptive Co-location with Combo.Binghao Chen, Han Zhao, Weihao Cui, Yifu He, Shulai Zhang, Quan Chen, Zijun Li, Minyi Guo
2023ICPADSMicroless: Cost-Efficient Hybrid Deployment of Microservices on IaaS VMs and Serverless.Jiagan Cheng, Yilong Zhao, Zijun Li, Quan Chen, Weihao Cui, Minyi Guo
2023OSDIOptimizing Dynamic Neural Networks with Brainstorm.Weihao Cui, Zhenhua Han, Lingji Ouyang, Yichuan Wang, Ningxin Zheng, Lingxiao Ma, Yuqing Yang, Fan Yang, Jilong Xue, Lili Qiu, Lidong Zhou, Quan Chen, Haisheng Tan, Minyi Guo
2022HPCATacker: Tensor-CUDA Core Kernel Fusion for Improving the GPU Utilization while Ensuring QoS.Han Zhao, Weihao Cui, Quan Chen, Youtao Zhang, Yanchao Lu, Chao Li, Jingwen Leng, Minyi Guo
2022ICSPAME: precision-aware multi-exit DNN serving for reducing latencies of batched inferences.Shulai Zhang, Weihao Cui, Quan Chen, Zhengnian Zhang, Yue Guan, Jingwen Leng, Chao Li, Minyi Guo
2022USENIXDVABatch: Diversity-aware Multi-Entry Multi-Exit Batching for Efficient Processing of DNN Services on GPUs.Weihao Cui, Han Zhao, Quan Chen, Hao Wei, Zirui Li, Deze Zeng, Chao Li, Minyi Guo
2021ICCDExploiting Intra-SM Parallelism in GPUs via Persistent and Elastic Blocks.Han Zhao, Weihao Cui, Quan Chen, Jieru Zhao, Jingwen Leng, Minyi Guo
2021SCEnable simultaneous DNN services based on deterministic operator overlap and precise latency prediction.Weihao Cui, Han Zhao, Quan Chen, Ningxin Zheng, Jingwen Leng, Jieru Zhao, Zhuo Song, Tao Ma, Yong Yang, Chao Li, Minyi Guo
2020ICDCSCODA: Improving Resource Utilization by Slimming and Co-locating DNN and CPU Jobs.Han Zhao, Weihao Cui, Quan Chen, Jingwen Leng, Kai Yu, Deze Zeng, Chao Li, Minyi Guo
2019ICCDEbird: Elastic Batch for Improving Responsiveness and Throughput of Deep Learning Services.Weihao Cui, Mengze Wei, Quan Chen, Xiaoxin Tang, Jingwen Leng, Li Li, Mingyi Guo
2019ICSLaius: Towards latency awareness and improved utilization of spatial multitasking accelerators in datacenters.Wei Zhang, Weihao Cui, Kaihua Fu, Quan Chen, Daniel Edward Mawhirter, Bo Wu, Chao Li, Minyi Guo