Weihao Cui
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
21
Venues
12
Active years
2019–2026
Best venue rank
A*
Where they publish
Papers
21 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ASPLOS | Towards High-Goodput LLM Serving with Prefill-decode Multiplexing. | Yukang Chen, Weihao Cui, Han Zhao, Ziyi Xu, Xiaoze Fan, Xusheng Chen, Yangjie Zhou, Shixuan Sun, Bingsheng He, Quan Chen |
| 2026 | EuroSys | Arena: Efficiently Training Large Models via Dynamic Scheduling and Adaptive Parallelism Co-Design. | Chunyu Xue, Weihao Cui, Quan Chen, Chen Chen, Han Zhao, Shulai Zhang, Linmei Wang, Yan Li, Limin Xiao, Weifeng Zhang, Jing Yang, Bingsheng He, Minyi Guo |
| 2026 | HPCA | LEGO: Supporting LLM-Enhanced Games with One Gaming GPU. | Han Zhao, Weihao Cui, Zeshen Zhang, Wenhao Zhang, Jiangtong Li, Quan Chen, Pu Pang, Zijun Li, Zhenhua Han, Yuqing Yang, Minyi Guo |
| 2026 | NSDI | FLARE: Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale. | Weihao Cui, Ji Zhang, Han Zhao, Chao Liu, Jian Sha, Bo Sang, Bingsheng He, Minyi Guo, Quan Chen |
| 2026 | NSDI | MuxTune: Efficient Multi-Task LLM Fine-Tuning in Multi-Tenant Datacenters via Spatial-Temporal Backbone Multiplexing. | Chunyu Xue, Yi Pan, Weihao Cui, Quan Chen, Shulai Zhang, Bingsheng He, Minyi Guo |
| 2025 | ASPLOS | Voyager: Input-Adaptive Algebraic Transformations for High-Performance Graph Neural Networks. | Yangjie Zhou, Wenting Shen, Jingwen Leng, Shuwen Lu, Zihan Liu, Weihao Cui, Zhendong Zhang, Wencong Xiao, Baole Ai, Yong Li, Wei Lin, Deze Zeng, Yun Liang, Quan Chen, Ning Liu, Minyi Guo |
| 2025 | EuroSys | Improving GPU Sharing Performance through Adaptive Bubbleless Spatial-Temporal Sharing. | Shulai Zhang, Quan Chen, Weihao Cui, Han Zhao, Chunyu Xue, Zhen Zheng, Wei Lin, Minyi Guo |
| 2025 | HPCA | VQ-LLM: High-performance Code Generation for Vector Quantization Augmented LLM Inference. | Zihan Liu, Xinhao Luo, Junxian Guo, Wentao Ni, Yangjie Zhou, Yue Guan, Cong Guo, Weihao Cui, Yu Feng, Minyi Guo, Yuhao Zhu, Minjia Zhang, Chen Jin, Jingwen Leng |
| 2025 | SC | A Sample-Free Compilation Framework for Efficient Dynamic Tensor Computation. | Yangjie Zhou, Honglin Zhu, Qian Qiu, Weihao Cui, Zihan Liu, Peng Chen, Mohamed Wahib, Cong Guo, Siyuan Feng, Jintao Meng, Haidong Lan, Jingwen Leng, Yun Lin, Jin Song Dong, Wenxi Zhu, Minwen Deng |
| 2025 | USENIX | Efficient Performance-Aware GPU Sharing with Compatibility and Isolation through Kernel Space Interception. | Shulai Zhang, Ao Xu, Quan Chen, Han Zhao, Weihao Cui, Zhen Wang, Yan Li, Limin Xiao, Minyi Guo |
| 2023 | CLOUD | Maximizing the Utilization of GPUs Used by Cloud Gaming through Adaptive Co-location with Combo. | Binghao Chen, Han Zhao, Weihao Cui, Yifu He, Shulai Zhang, Quan Chen, Zijun Li, Minyi Guo |
| 2023 | ICPADS | Microless: Cost-Efficient Hybrid Deployment of Microservices on IaaS VMs and Serverless. | Jiagan Cheng, Yilong Zhao, Zijun Li, Quan Chen, Weihao Cui, Minyi Guo |
| 2023 | OSDI | Optimizing Dynamic Neural Networks with Brainstorm. | Weihao Cui, Zhenhua Han, Lingji Ouyang, Yichuan Wang, Ningxin Zheng, Lingxiao Ma, Yuqing Yang, Fan Yang, Jilong Xue, Lili Qiu, Lidong Zhou, Quan Chen, Haisheng Tan, Minyi Guo |
| 2022 | HPCA | Tacker: Tensor-CUDA Core Kernel Fusion for Improving the GPU Utilization while Ensuring QoS. | Han Zhao, Weihao Cui, Quan Chen, Youtao Zhang, Yanchao Lu, Chao Li, Jingwen Leng, Minyi Guo |
| 2022 | ICS | PAME: precision-aware multi-exit DNN serving for reducing latencies of batched inferences. | Shulai Zhang, Weihao Cui, Quan Chen, Zhengnian Zhang, Yue Guan, Jingwen Leng, Chao Li, Minyi Guo |
| 2022 | USENIX | DVABatch: Diversity-aware Multi-Entry Multi-Exit Batching for Efficient Processing of DNN Services on GPUs. | Weihao Cui, Han Zhao, Quan Chen, Hao Wei, Zirui Li, Deze Zeng, Chao Li, Minyi Guo |
| 2021 | ICCD | Exploiting Intra-SM Parallelism in GPUs via Persistent and Elastic Blocks. | Han Zhao, Weihao Cui, Quan Chen, Jieru Zhao, Jingwen Leng, Minyi Guo |
| 2021 | SC | Enable simultaneous DNN services based on deterministic operator overlap and precise latency prediction. | Weihao Cui, Han Zhao, Quan Chen, Ningxin Zheng, Jingwen Leng, Jieru Zhao, Zhuo Song, Tao Ma, Yong Yang, Chao Li, Minyi Guo |
| 2020 | ICDCS | CODA: Improving Resource Utilization by Slimming and Co-locating DNN and CPU Jobs. | Han Zhao, Weihao Cui, Quan Chen, Jingwen Leng, Kai Yu, Deze Zeng, Chao Li, Minyi Guo |
| 2019 | ICCD | Ebird: Elastic Batch for Improving Responsiveness and Throughput of Deep Learning Services. | Weihao Cui, Mengze Wei, Quan Chen, Xiaoxin Tang, Jingwen Leng, Li Li, Mingyi Guo |
| 2019 | ICS | Laius: Towards latency awareness and improved utilization of spatial multitasking accelerators in datacenters. | Wei Zhang, Weihao Cui, Kaihua Fu, Quan Chen, Daniel Edward Mawhirter, Bo Wu, Chao Li, Minyi Guo |