Skip to content

Zhewei Yao

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

34

Venues

13

Active years

2019–2026

Best venue rank

A*

Where they publish

Papers

34 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLR³-SQL: Ranking Reward and Resampling for Text-to-SQL.Hojae Han, Yeonseok Jeong, Seung-won Hwang, Zhewei Yao, Yuxiong He
2026ACLAgentic Verification for Ambiguous Query Disambiguation.Youngwon Lee, Seung-won Hwang, Ruofan Wu, Feng Yan, Danmei Xu, Moutasem Akkad, Zhewei Yao, Yuxiong He
2026ACLGRAD: Generalizing RAG Adaptation with Decoding.Youngwon Lee, Seung-won Hwang, Zhewei Yao, Yuxiong He
2026ACLArctic-Text2SQL-R1: Simple Rewards, Strong Reasoning in Text-to-SQL.Zhewei Yao, Guoheng Sun, Lukasz Borchmann, Zheyu Shen, Minghang Deng, Bohan Zhai, Hao Zhang, Ang Li, Yuxiong He
2026EACLTAGQuant: Token-Aware Clustering for Group-Wise Quantization.Jaeseong Lee, Seung-won Hwang, Aurick Qiao, Zhewei Yao, Yuxiong He
2025ACLSTUN: Structured-Then-Unstructured Pruning for Scalable MoE Pruning.Jaeseong Lee, Seung-won Hwang, Aurick Qiao, Daniel F. Campos, Zhewei Yao, Yuxiong He
2025ACLOptimizing Reasoning for Text-to-SQL with Execution Feedback.Bohan Zhai, Canwen Xu, Yuxiong He, Zhewei Yao
2025EMNLPSwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation.Aurick Qiao, Zhewei Yao, Samyam Rajbhandari, Yuxiong He
2025NAACLInference Scaling for Bridging Retrieval and Augmented Generation.Youngwon Lee, Seung-won Hwang, Daniel F. Campos, Filip Gralinski, Zhewei Yao, Yuxiong He
2025NAACLCORD: Balancing COnsistency and Rank Distillation for Robust Retrieval-Augmented Generation.Youngwon Lee, Seung-won Hwang, Daniel F. Campos, Filip Gralinski, Zhewei Yao, Yuxiong He
2024AAAIDeepSpeed Data Efficiency: Improving Deep Learning Model Quality and Training Efficiency via Efficient Data Sampling and Routing.Conglong Li, Zhewei Yao, Xiaoxia Wu, Minjia Zhang, Connor Holmes, Cheng Li, Yuxiong He
2024AAAIExploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation.Zhewei Yao, Xiaoxia Wu, Cheng Li, Stephen Youn, Yuxiong He
2024ICLRZeRO++: Extremely Efficient Collective Communication for Large Model Training.Guanhua Wang, Heyang Qin, Sam Ade Jacobs, Xiaoxia Wu, Connor Holmes, Zhewei Yao, Samyam Rajbhandari, Olatunji Ruwase, Feng Yan, Lei Yang, Yuxiong He
2024USENIXQuant-LLM: Accelerating the Serving of Large Language Models via FP6-Centric Algorithm-System Co-Design on Modern GPUs.Haojun Xia, Zhen Zheng, Xiaoxia Wu, Shiyang Chen, Zhewei Yao, Stephen Youn, Arash Bakhtiari, Michael Wyatt, Donglin Zhuang, Zhongzhu Zhou, Olatunji Ruwase, Yuxiong He, Shuaiwen Leon Song
2023EMNLPScaling Vision-Language Models with Sparse Mixture of Experts.Sheng Shen, Zhewei Yao, Chunyuan Li, Trevor Darrell, Kurt Keutzer, Yuxiong He
2023ICLRDySR: Adaptive Super-Resolution via Algorithm and System Co-design.Syed Zawad, Cheng Li, Zhewei Yao, Elton Zheng, Yuxiong He, Feng Yan
2023ICMLUnderstanding Int4 Quantization for Language Models: Latency Speedup, Composability, and Failure Cases.Xiaoxia Wu, Cheng Li, Reza Yazdani Aminabadi, Zhewei Yao, Yuxiong He
2022ICASSPInteger-Only Zero-Shot Quantization for Efficient Speech Recognition.Sehoon Kim, Amir Gholami, Zhewei Yao, Nicholas Lee, Patrick Wang, Aniruddha Nrusimha, Bohan Zhai, Tianren Gao, Michael W. Mahoney, Kurt Keutzer
2022ICLRHow Much Can CLIP Benefit Vision-and-Language Tasks?Sheng Shen, Liunian Harold Li, Hao Tan, Mohit Bansal, Anna Rohrbach, Kai-Wei Chang, Zhewei Yao, Kurt Keutzer
2022ICMLDeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale.Samyam Rajbhandari, Conglong Li, Zhewei Yao, Minjia Zhang, Reza Yazdani Aminabadi, Ammar Ahmad Awan, Jeff Rasley, Yuxiong He
2022WACVHessian-Aware Pruning and Optimal Neural Implant.Shixing Yu, Zhewei Yao, Amir Gholami, Zhen Dong, Sehoon Kim, Michael W. Mahoney, Kurt Keutzer
2021AAAIADAHESSIAN: An Adaptive Second Order Optimizer for Machine Learning.Zhewei Yao, Amir Gholami, Sheng Shen, Mustafa Mustafa, Kurt Keutzer, Michael W. Mahoney
2021EMNLPWhat's Hidden in a One-layer Randomly Weighted Transformer?Sheng Shen, Zhewei Yao, Douwe Kiela, Kurt Keutzer, Michael W. Mahoney
2021ICMLActNN: Reducing Training Memory Footprint via 2-Bit Activation Compressed Training.Jianfei Chen, Lianmin Zheng, Zhewei Yao, Dequan Wang, Ion Stoica, Michael W. Mahoney, Joseph Gonzalez
2021ICMLI-BERT: Integer-only BERT Quantization.Sehoon Kim, Amir Gholami, Zhewei Yao, Michael W. Mahoney, Kurt Keutzer
2021ICMLHAWQ-V3: Dyadic Neural Network Quantization.Zhewei Yao, Zhen Dong, Zhangcheng Zheng, Amir Gholami, Jiali Yu, Eric Tan, Leyuan Wang, Qijing Huang, Yida Wang, Michael W. Mahoney, Kurt Keutzer
2020AAAIInefficiency of K-FAC for Large Batch Size Training.Linjian Ma, Gabe Montague, Jiayu Ye, Zhewei Yao, Amir Gholami, Kurt Keutzer, Michael W. Mahoney
2020AAAIQ-BERT: Hessian Based Ultra Low Precision Quantization of BERT.Sheng Shen, Zhen Dong, Jiayu Ye, Linjian Ma, Zhewei Yao, Amir Gholami, Michael W. Mahoney, Kurt Keutzer
2020CVPRZeroQ: A Novel Zero Shot Quantization Framework.Yaohui Cai, Zhewei Yao, Zhen Dong, Amir Gholami, Michael W. Mahoney, Kurt Keutzer
2020EMNLPMAF: Multimodal Alignment Framework for Weakly-Supervised Phrase Grounding.Qinxin Wang, Hao Tan, Sheng Shen, Michael W. Mahoney, Zhewei Yao
2020ICMLPowerNorm: Rethinking Batch Normalization in Transformers.Sheng Shen, Zhewei Yao, Amir Gholami, Michael W. Mahoney, Kurt Keutzer
2020ICPRAMJumpReLU: A Retrofit Defense Strategy for Adversarial Attacks.N. Benjamin Erichson, Zhewei Yao, Michael W. Mahoney
2019CVPRTrust Region Based Adversarial Attack on Neural Networks.Zhewei Yao, Amir Gholami, Peng Xu, Kurt Keutzer, Michael W. Mahoney
2019ICCVHAWQ: Hessian AWare Quantization of Neural Networks With Mixed-Precision.Zhen Dong, Zhewei Yao, Amir Gholami, Michael W. Mahoney, Kurt Keutzer