| 2026 | COLT | Avoiding exp(k | Tianyuan Jin, Heyang Zhao, Vincent Y. F. Tan, Quanquan Gu |
| 2025 | ICLR | Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration. | Heyang Zhao, Xingrui Yu, David Mark Bossens, Ivor W. Tsang, Quanquan Gu |
| 2025 | ICML | Logarithmic Regret for Online KL-Regularized Reinforcement Learning. | Heyang Zhao, Chenlu Ye, Wei Xiong, Quanquan Gu, Tong Zhang |
| 2024 | ICLR | Variance-aware Regret Bounds for Stochastic Contextual Dueling Bandits. | Qiwei Di, Tao Jin, Yue Wu, Heyang Zhao, Farzad Farnoud, Quanquan Gu |
| 2024 | ICLR | Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning. | Qiwei Di, Heyang Zhao, Jiafan He, Quanquan Gu |
| 2024 | ICML | Feel-Good Thompson Sampling for Contextual Dueling Bandits. | Xuheng Li, Heyang Zhao, Quanquan Gu |
| 2023 | COLT | Variance-Dependent Regret Bounds for Linear Bandits and Reinforcement Learning: Adaptivity and Computational Efficiency. | Heyang Zhao, Jiafan He, Dongruo Zhou, Tong Zhang, Quanquan Gu |
| 2023 | ICML | Nearly Minimax Optimal Reinforcement Learning for Linear Markov Decision Processes. | Jiafan He, Heyang Zhao, Dongruo Zhou, Quanquan Gu |
| 2023 | ICML | Optimal Online Generalized Linear Regression with Stochastic Noise and Its Application to Heteroscedastic Bandits. | Heyang Zhao, Dongruo Zhou, Jiafan He, Quanquan Gu |
| 2022 | NDSS | ProvTalk: Towards Interpretable Multi-level Provenance Analysis in Networking Functions Virtualization (NFV). | Azadeh Tabiban, Heyang Zhao, Yosr Jarraya, Makan Pourzandi, Mengyuan Zhang, Lingyu Wang |