| 2025 | AISTATS | What and How does In-Context Learning Learn? Bayesian Model Averaging, Parameterization, and Generalization. | Yufeng Zhang, Fengzhuo Zhang, Zhuoran Yang, Zhaoran Wang |
| 2025 | EMNLP | Toward Optimal LLM Alignments Using Two-Player Games. | Rui Zheng, Hongyi Guo, Zhihan Liu, Xiaoying Zhang, Yuanshun Yao, Xiaojun Xu, Zhaoran Wang, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang, Yang Liu, Hang Li |
| 2025 | ICLR | Are Transformers Able to Reason by Connecting Separated Knowledge in Training Data? | Yutong Yin, Zhaoran Wang |
| 2025 | ICML | BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning. | Han Zhong, Yutong Yin, Shenao Zhang, Xiaojun Xu, Yuanxin Liu, Yifei Zuo, Zhihan Liu, Boyi Liu, Sirui Zheng, Hongyi Guo, Liwei Wang, Mingyi Hong, Zhaoran Wang |
| 2025 | ICML | An Instrumental Value for Data Production and its Application to Data Pricing. | Rui Ai, Boxiang Lyu, Zhaoran Wang, Zhuoran Yang, Haifeng Xu |
| 2025 | ICML | The Sample Complexity of Online Strategic Decision Making with Information Asymmetry and Knowledge Transportability. | Jiachen Hu, Rui Ai, Han Zhong, Xiaoyu Chen, Liwei Wang, Zhaoran Wang, Zhuoran Yang |
| 2025 | ICML | Reward-Augmented Data Enhances Direct Preference Alignment of LLMs. | Shenao Zhang, Zhihan Liu, Boyi Liu, Yufeng Zhang, Yingxiang Yang, Yongfei Liu, Liyu Chen, Tao Sun, Zhaoran Wang |
| 2025 | IROS | Advancing Object-Goal Navigation through LLM-enhanced Object Affinities Transfer. | Mengying Lin, Shugao Liu, Dingxi Zhang, Yaran Chen, Zhaoran Wang, Haoran Li, Dongbin Zhao |
| 2024 | ICLR | Let Models Speak Ciphers: Multiagent Debate through Embeddings. | Chau Pham, Boyi Liu, Yingxiang Yang, Zhengyu Chen, Tianyi Liu, Jianbo Yuan, Bryan A. Plummer, Zhaoran Wang, Hongxia Yang |
| 2024 | ICLR | Sample-Efficient Multi-Agent RL: An Optimization Perspective. | Nuoya Xiong, Zhihan Liu, Zhaoran Wang, Zhuoran Yang |
| 2024 | ICML | Adaptive-Gradient Policy Optimization: Enhancing Policy Learning in Non-Smooth Differentiable Simulations. | Feng Gao, Liangzhi Shi, Shenao Zhang, Zhaoran Wang, Yi Wu |
| 2024 | ICML | Reason for Future, Act for Now: A Principled Architecture for Autonomous LLM Agents. | Zhihan Liu, Hao Hu, Shenao Zhang, Hongyi Guo, Shuqi Ke, Boyi Liu, Zhaoran Wang |
| 2024 | ICML | A General Framework for Sequential Decision-Making under Adaptivity Constraints. | Nuoya Xiong, Zhaoran Wang, Zhuoran Yang |
| 2024 | ICML | How Does Goal Relabeling Improve Sample Efficiency? | Sirui Zheng, Chenjia Bai, Zhuoran Yang, Zhaoran Wang |
| 2023 | AISTATS | Finding Regularized Competitive Equilibria of Heterogeneous Agent Macroeconomic Models via Reinforcement Learning. | Ruitu Xu, Yifei Min, Tianhao Wang, Michael I. Jordan, Zhaoran Wang, Zhuoran Yang |
| 2023 | APNOMS | Progress and Challenges of Polymorphic Smart Networks. | Peixin Liu, Xiangyu Bai, Zhaoran Wang |
| 2023 | COMPSAC | Deep Learning for Regional Subsidence Crisis Prediction in Smart Grid Infrastructure. | Zhaoran Wang, Xiangyu Bai, Yu Han |
| 2023 | ICLR | Represent to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency. | Lingxiao Wang, Qi Cai, Zhuoran Yang, Zhaoran Wang |
| 2023 | ICLR | Pessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes. | Miao Lu, Yifei Min, Zhaoran Wang, Zhuoran Yang |
| 2023 | ICLR | Latent Variable Representation for Reinforcement Learning. | Tongzheng Ren, Chenjun Xiao, Tianjun Zhang, Na Li, Zhaoran Wang, Sujay Sanghavi, Dale Schuurmans, Bo Dai |
| 2023 | ICLR | Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization. | Haoran Xu, Li Jiang, Jianxiong Li, Zhuoran Yang, Zhaoran Wang, Wai Kin Victor Chan, Xianyuan Zhan |
| 2023 | ICLR | Optimistic Exploration with Learned Features Provably Solves Markov Decision Processes with Neural Dynamics. | Sirui Zheng, Lingxiao Wang, Shuang Qiu, Zuyue Fu, Zhuoran Yang, Csaba Szepesvri, Zhaoran Wang |
| 2023 | ICML | Enforcing Hard Constraints with Soft Barriers: Safe Reinforcement Learning in Unknown Stochastic Environments. | Yixuan Wang, Simon Sinong Zhan, Ruochen Jiao, Zhilu Wang, Wanxin Jin, Zhuoran Yang, Zhaoran Wang, Chao Huang, Qi Zhu |
| 2023 | ICML | Local Optimization Achieves Global Optimality in Multi-Agent Reinforcement Learning. | Yulai Zhao, Zhuoran Yang, Zhaoran Wang, Jason D. Lee |
| 2023 | ICML | Achieving Hierarchy-Free Approximation for Bilevel Programs with Equilibrium Constraints. | Jiayang Li, Jing Yu, Boyi Liu, Yu Marco Nie, Zhaoran Wang |
| 2023 | ICML | Adaptive Barrier Smoothing for First-Order Policy Gradient with Contact Dynamics. | Shenao Zhang, Wanxin Jin, Zhaoran Wang |
| 2022 | AISTATS | Gap-Dependent Bounds for Two-Player Markov Games. | Zehao Dou, Zhuoran Yang, Zhaoran Wang, Simon S. Du |
| 2022 | DAC | Design-while-verify: correct-by-construction control learning with verification in the loop. | Yixuan Wang, Chao Huang, Zhaoran Wang, Zhilu Wang, Qi Zhu |
| 2022 | ICLR | Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning. | Chenjia Bai, Lingxiao Wang, Zhuoran Yang, Zhi-Hong Deng, Animesh Garg, Peng Liu, Zhaoran Wang |
| 2022 | ICLR | Towards General Function Approximation in Zero-Sum Markov Games. | Baihe Huang, Jason D. Lee, Zhaoran Wang, Zhuoran Yang |
| 2022 | ICML | Reinforcement Learning from Partial Observation: Linear Function Approximation with Provable Sample Efficiency. | Qi Cai, Zhuoran Yang, Zhaoran Wang |
| 2022 | ICML | Adaptive Model Design for Markov Decision Process. | Siyu Chen, Donglin Yang, Jiayang Li, Senmiao Wang, Zhuoran Yang, Zhaoran Wang |
| 2022 | ICML | Human-in-the-loop: Provably Efficient Preference-based Reinforcement Learning with General Function Approximation. | Xiaoyu Chen, Han Zhong, Zhuoran Yang, Zhaoran Wang, Liwei Wang |
| 2022 | ICML | Provably Efficient Offline Reinforcement Learning for Partially Observable Markov Decision Processes. | Hongyi Guo, Qi Cai, Yufeng Zhang, Zhuoran Yang, Zhaoran Wang |
| 2022 | ICML | Welfare Maximization in Competitive Equilibrium: Reinforcement Learning for Markov Exchange Economy. | Zhihan Liu, Miao Lu, Zhaoran Wang, Michael I. Jordan, Zhuoran Yang |
| 2022 | ICML | Learning from Demonstration: Provably Efficient Adversarial Policy Imitation with Linear Function Approximation. | Zhihan Liu, Yufeng Zhang, Zuyue Fu, Zhuoran Yang, Zhaoran Wang |
| 2022 | ICML | Pessimism meets VCG: Learning Dynamic Mechanism Design via Offline Reinforcement Learning. | Boxiang Lyu, Zhaoran Wang, Mladen Kolar, Zhuoran Yang |
| 2022 | ICML | Contrastive UCB: Provably Efficient Contrastive Self-Supervised Learning in Online Reinforcement Learning. | Shuang Qiu, Lingxiao Wang, Chenjia Bai, Zhuoran Yang, Zhaoran Wang |
| 2022 | ICML | Pessimistic Minimax Value Iteration: Provably Efficient Equilibrium Learning from Offline Datasets. | Han Zhong, Wei Xiong, Jiyuan Tan, Liwei Wang, Tong Zhang, Zhaoran Wang, Zhuoran Yang |
| 2022 | SENSYS | Accelerate online reinforcement learning for building HVAC control with heterogeneous expert guidances. | Shichao Xu, Yangyang Fu, Yixuan Wang, Zhuoran Yang, Zheng O'Neill, Zhaoran Wang, Qi Zhu |
| 2021 | AISTATS | Provably Efficient Safe Exploration via Primal-Dual Policy Optimization. | Dongsheng Ding, Xiaohan Wei, Zhuoran Yang, Zhaoran Wang, Mihailo R. Jovanovic |
| 2021 | AISTATS | Sample Elicitation. | Jiaheng Wei, Zuyue Fu, Yang Liu, Xingyu Li, Zhuoran Yang, Zhaoran Wang |
| 2021 | AISTATS | Provably Efficient Actor-Critic for Risk-Sensitive and Robust Adversarial RL: A Linear-Quadratic Case. | Yufeng Zhang, Zhuoran Yang, Zhaoran Wang |
| 2021 | DAC | Cocktail: Learn a Better Neural Network Controller from Multiple Experts via Adaptive Mixing and Robust Distillation. | Yixuan Wang, Chao Huang, Zhilu Wang, Shichao Xu, Zhaoran Wang, Qi Zhu |
| 2021 | ICLR | Single-Timescale Actor-Critic Provably Finds Globally Optimal Policy. | Zuyue Fu, Zhuoran Yang, Zhaoran Wang |
| 2021 | ICML | Principled Exploration via Optimistic Bootstrapping and Backward Induction. | Chenjia Bai, Lingxiao Wang, Lei Han, Jianye Hao, Animesh Garg, Peng Liu, Zhaoran Wang |
| 2021 | ICML | Risk-Sensitive Reinforcement Learning with Function Approximation: A Debiasing Approach. | Yingjie Fei, Zhuoran Yang, Zhaoran Wang |
| 2021 | ICML | Decentralized Single-Timescale Actor-Critic on Zero-Sum Two-Player Stochastic Games. | Hongyi Guo, Zuyue Fu, Zhuoran Yang, Zhaoran Wang |
| 2021 | ICML | Randomized Exploration in Reinforcement Learning with General Value Function Approximation. | Haque Ishfaq, Qiwen Cui, Viet Nguyen, Alex Ayoub, Zhuoran Yang, Zhaoran Wang, Doina Precup, Lin Yang |
| 2021 | ICML | Is Pessimism Provably Efficient for Offline RL? | Ying Jin, Zhuoran Yang, Zhaoran Wang |
| 2021 | ICML | Infinite-Dimensional Optimization for Zero-Sum Games via Variational Transport. | Lewis Liu, Yufeng Zhang, Zhuoran Yang, Reza Babanezhad, Zhaoran Wang |
| 2021 | ICML | Provably Efficient Fictitious Play Policy Optimization for Zero-Sum Markov Games with Structured Transitions. | Shuang Qiu, Xiaohan Wei, Jieping Ye, Zhaoran Wang, Zhuoran Yang |
| 2021 | ICML | On Reward-Free RL with Kernel and Neural Function Approximations: Single-Agent MDP and Markov Game. | Shuang Qiu, Jieping Ye, Zhaoran Wang, Zhuoran Yang |
| 2021 | ICML | Global Convergence of Policy Gradient for Linear-Quadratic Mean-Field Control/Game in Continuous Time. | Weichen Wang, Jiequn Han, Zhuoran Yang, Zhaoran Wang |
| 2021 | ICML | Learning While Playing in Mean-Field Games: Convergence and Optimality. | Qiaomin Xie, Zhuoran Yang, Zhaoran Wang, Andreea Minca |
| 2021 | ICML | Doubly Robust Off-Policy Actor-Critic: Convergence and Optimality. | Tengyu Xu, Zhuoran Yang, Zhaoran Wang, Yingbin Liang |
| 2021 | ISPA | Trajectory Privacy Protection Method based on Shadow vehicles. | Yaqiong Ma, Xiangyu Bai, Zhaoran Wang |
| 2020 | COLT | Provably efficient reinforcement learning with linear function approximation. | Chi Jin, Zhuoran Yang, Zhaoran Wang, Michael I. Jordan |
| 2020 | COLT | Learning Zero-Sum Simultaneous-Move Markov Games Using Function Approximation and Correlated Equilibrium. | Qiaomin Xie, Yudong Chen, Zhaoran Wang, Zhuoran Yang |
| 2020 | ICLR | On Computation and Generalization of Generative Adversarial Imitation Learning. | Minshuo Chen, Yizhou Wang, Tianyi Liu, Zhuoran Yang, Xingguo Li, Zhaoran Wang, Tuo Zhao |
| 2020 | ICLR | Actor-Critic Provably Finds Nash Equilibria of Linear-Quadratic Mean-Field Games. | Zuyue Fu, Zhuoran Yang, Yongxin Chen, Zhaoran Wang |
| 2020 | ICLR | Neural Policy Gradient Methods: Global Optimality and Rates of Convergence. | Lingxiao Wang, Qi Cai, Zhuoran Yang, Zhaoran Wang |
| 2020 | ICML | Provably Efficient Exploration in Policy Optimization. | Qi Cai, Zhuoran Yang, Chi Jin, Zhaoran Wang |
| 2020 | ICML | Computational and Statistical Tradeoffs in Inferring Combinatorial Structures of Ising Model. | Ying Jin, Zhaoran Wang, Junwei Lu |
| 2020 | ICML | Semiparametric Nonlinear Bipartite Graph Representation Learning with Provable Guarantees. | Sen Na, Yuwei Luo, Zhuoran Yang, Zhaoran Wang, Mladen Kolar |
| 2020 | ICML | Deep Reinforcement Learning with Robust and Smooth Policy. | Qianli Shen, Yan Li, Haoming Jiang, Zhaoran Wang, Tuo Zhao |
| 2020 | ICML | On the Global Optimality of Model-Agnostic Meta-Learning. | Lingxiao Wang, Qi Cai, Zhuoran Yang, Zhaoran Wang |
| 2020 | ICML | Breaking the Curse of Many Agents: Provable Mean Embedding Q-Iteration for Mean-Field Reinforcement Learning. | Lingxiao Wang, Zhuoran Yang, Zhaoran Wang |
| 2020 | ICML | Generative Adversarial Imitation Learning with Neural Network Parameterization: Global Optimality and Convergence Rate. | Yufeng Zhang, Qi Cai, Zhuoran Yang, Zhaoran Wang |
| 2019 | ICLR | Accelerating Nonconvex Learning via Replica Exchange Langevin diffusion. | Yi Chen, Jinglin Chen, Jing Dong, Jian Peng, Zhaoran Wang |
| 2019 | ICLR | Off-Policy Evaluation and Learning from Logged Bandit Feedback: Error Reduction via Surrogate Policy. | Yuan Xie, Boyi Liu, Qiang Liu, Zhaoran Wang, Yuan Zhou, Jian Peng |
| 2019 | ICML | On the statistical rate of nonlinear recovery in generative models with heavy-tailed data. | Xiaohan Wei, Zhuoran Yang, Zhaoran Wang |
| 2018 | AISTATS | Minimax-Optimal Privacy-Preserving Sparse PCA in Distributed Systems. | Jason Ge, Zhaoran Wang, Mengdi Wang, Han Liu |
| 2018 | AISTATS | Nonlinear Structured Signal Estimation in High Dimensions via Iterative Hard Thresholding. | Kaiqing Zhang, Zhuoran Yang, Zhaoran Wang |
| 2018 | ICDM | Dynamic Truth Discovery on Numerical Data. | Shi Zhi, Fan Yang, Zheyi Zhu, Qi Li, Zhaoran Wang, Jiawei Han |
| 2018 | ICML | The Edge Density Barrier: Computational-Statistical Tradeoffs in Combinatorial Inference. | Hao Lu, Yuan Cao, Junwei Lu, Han Liu, Zhaoran Wang |
| 2018 | ITA | Symmetry. Saddle Points, and Global Optimization Landscape of Nonconvex Matrix Factorization. | Xingguo Li, Jarvis D. Haupt, Junwei Lu, Zhaoran Wang, Raman Arora, Han Liu, Tuo Zhao |
| 2016 | AISTATS | Low-Rank and Sparse Structure Pursuit via Alternating Minimization. | Quanquan Gu, Zhaoran Wang, Han Liu |
| 2016 | ICML | On the Statistical Limits of Convex Relaxations. | Zhaoran Wang, Quanquan Gu, Han Liu |
| 2016 | ICML | Sparse Nonlinear Regression: Parameter Estimation under Nonconvexity. | Zhuoran Yang, Zhaoran Wang, Han Liu, Yonina C. Eldar, Tong Zhang |
| 2016 | KDD | A Truth Discovery Approach with Theoretical Guarantee. | Houping Xiao, Jing Gao, Zhaoran Wang, Shiyu Wang, Lu Su, Han Liu |
| 2013 | AISTATS | Sparse Principal Component Analysis for High Dimensional Multivariate Time Series. | Zhaoran Wang, Fang Han, Han Liu |