| 2026 | COLT | Optimism Stabilizes Thompson Sampling for Adaptive Inference. | Shunxing Yan, Han Zhong |
| 2025 | ICML | DPO Meets PPO: Reinforced Token Optimization for RLHF. | Han Zhong, Zikang Shan, Guhao Feng, Wei Xiong, Xinle Cheng, Li Zhao, Di He, Jiang Bian, Liwei Wang |
| 2025 | ICML | BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning. | Han Zhong, Yutong Yin, Shenao Zhang, Xiaojun Xu, Yuanxin Liu, Yifei Zuo, Zhihan Liu, Boyi Liu, Sirui Zheng, Hongyi Guo, Liwei Wang, Mingyi Hong, Zhaoran Wang |
| 2025 | ICML | The Sample Complexity of Online Strategic Decision Making with Information Asymmetry and Knowledge Transportability. | Jiachen Hu, Rui Ai, Han Zhong, Xiaoyu Chen, Liwei Wang, Zhaoran Wang, Zhuoran Yang |
| 2024 | AISTATS | Horizon-Free and Instance-Dependent Regret Bounds for Reinforcement Learning with General Function Approximation. | Jiayi Huang, Han Zhong, Liwei Wang, Lin Yang |
| 2024 | ICLR | Towards Robust Offline Reinforcement Learning under Diverse Data Corruption. | Rui Yang, Han Zhong, Jiawei Xu, Amy Zhang, Chongjie Zhang, Lei Han, Tong Zhang |
| 2024 | ICLR | Sample-efficient Learning of Infinite-horizon Average-reward MDPs with General Function Approximation. | Jianliang He, Han Zhong, Zhuoran Yang |
| 2024 | ICML | Provably Efficient Exploration in Quantum Reinforcement Learning with Logarithmic Worst-Case Regret. | Han Zhong, Jiachen Hu, Yecheng Xue, Tongyang Li, Liwei Wang |
| 2024 | ICML | Combinatorial Multivariant Multi-Armed Bandits with Applications to Episodic Reinforcement Learning and Beyond. | Xutong Liu, Siwei Wang, Jinhang Zuo, Han Zhong, Xuchuang Wang, Zhiyong Wang, Shuai Li, Mohammad Hajiesmaili, John C. S. Lui, Wei Chen |
| 2024 | ICML | Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment. | Rui Yang, Xiaoman Pan, Feng Luo, Shuang Qiu, Han Zhong, Dong Yu, Jianshu Chen |
| 2024 | ICML | Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-constraint. | Wei Xiong, Hanze Dong, Chenlu Ye, Ziqi Wang, Han Zhong, Heng Ji, Nan Jiang, Tong Zhang |
| 2024 | ICML | A3S: A General Active Clustering Method with Pairwise Constraints. | Xun Deng, Junlong Liu, Han Zhong, Fuli Feng, Chen Shen, Xiangnan He, Jieping Ye, Zheng Wang |
| 2023 | ICLR | Nearly Minimax Optimal Offline Reinforcement Learning with Linear Function Approximation: Single-Agent MDP and Markov Game. | Wei Xiong, Han Zhong, Chengshuai Shi, Cong Shen, Liwei Wang, Tong Zhang |
| 2023 | ICLR | Provable Sim-to-real Transfer in Continuous Domain with Partial Observations. | Jiachen Hu, Han Zhong, Chi Jin, Liwei Wang |
| 2022 | ICLR | A Reduction-Based Framework for Conservative Bandits and Reinforcement Learning. | Yunchang Yang, Tianhao Wu, Han Zhong, Evrard Garcelon, Matteo Pirotta, Alessandro Lazaric, Liwei Wang, Simon Shaolei Du |
| 2022 | ICML | Human-in-the-loop: Provably Efficient Preference-based Reinforcement Learning with General Function Approximation. | Xiaoyu Chen, Han Zhong, Zhuoran Yang, Zhaoran Wang, Liwei Wang |
| 2022 | ICML | Nearly Optimal Policy Optimization with Stable at Any Time Guarantee. | Tianhao Wu, Yunchang Yang, Han Zhong, Liwei Wang, Simon S. Du, Jiantao Jiao |
| 2022 | ICML | A Self-Play Posterior Sampling Algorithm for Zero-Sum Markov Games. | Wei Xiong, Han Zhong, Chengshuai Shi, Cong Shen, Tong Zhang |
| 2022 | ICML | Pessimistic Minimax Value Iteration: Provably Efficient Equilibrium Learning from Offline Datasets. | Han Zhong, Wei Xiong, Jiyuan Tan, Liwei Wang, Tong Zhang, Zhaoran Wang, Zhuoran Yang |