Skip to content

Zhaoran Wang

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

82

Venues

14

Active years

2013–2025

Best venue rank

A*

Where they publish

Papers

82 indexed papers, newest first.

YearVenueTitleAuthors
2025AISTATSWhat and How does In-Context Learning Learn? Bayesian Model Averaging, Parameterization, and Generalization.Yufeng Zhang, Fengzhuo Zhang, Zhuoran Yang, Zhaoran Wang
2025EMNLPToward Optimal LLM Alignments Using Two-Player Games.Rui Zheng, Hongyi Guo, Zhihan Liu, Xiaoying Zhang, Yuanshun Yao, Xiaojun Xu, Zhaoran Wang, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang, Yang Liu, Hang Li
2025ICLRAre Transformers Able to Reason by Connecting Separated Knowledge in Training Data?Yutong Yin, Zhaoran Wang
2025ICMLBRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning.Han Zhong, Yutong Yin, Shenao Zhang, Xiaojun Xu, Yuanxin Liu, Yifei Zuo, Zhihan Liu, Boyi Liu, Sirui Zheng, Hongyi Guo, Liwei Wang, Mingyi Hong, Zhaoran Wang
2025ICMLAn Instrumental Value for Data Production and its Application to Data Pricing.Rui Ai, Boxiang Lyu, Zhaoran Wang, Zhuoran Yang, Haifeng Xu
2025ICMLThe Sample Complexity of Online Strategic Decision Making with Information Asymmetry and Knowledge Transportability.Jiachen Hu, Rui Ai, Han Zhong, Xiaoyu Chen, Liwei Wang, Zhaoran Wang, Zhuoran Yang
2025ICMLReward-Augmented Data Enhances Direct Preference Alignment of LLMs.Shenao Zhang, Zhihan Liu, Boyi Liu, Yufeng Zhang, Yingxiang Yang, Yongfei Liu, Liyu Chen, Tao Sun, Zhaoran Wang
2025IROSAdvancing Object-Goal Navigation through LLM-enhanced Object Affinities Transfer.Mengying Lin, Shugao Liu, Dingxi Zhang, Yaran Chen, Zhaoran Wang, Haoran Li, Dongbin Zhao
2024ICLRLet Models Speak Ciphers: Multiagent Debate through Embeddings.Chau Pham, Boyi Liu, Yingxiang Yang, Zhengyu Chen, Tianyi Liu, Jianbo Yuan, Bryan A. Plummer, Zhaoran Wang, Hongxia Yang
2024ICLRSample-Efficient Multi-Agent RL: An Optimization Perspective.Nuoya Xiong, Zhihan Liu, Zhaoran Wang, Zhuoran Yang
2024ICMLAdaptive-Gradient Policy Optimization: Enhancing Policy Learning in Non-Smooth Differentiable Simulations.Feng Gao, Liangzhi Shi, Shenao Zhang, Zhaoran Wang, Yi Wu
2024ICMLReason for Future, Act for Now: A Principled Architecture for Autonomous LLM Agents.Zhihan Liu, Hao Hu, Shenao Zhang, Hongyi Guo, Shuqi Ke, Boyi Liu, Zhaoran Wang
2024ICMLA General Framework for Sequential Decision-Making under Adaptivity Constraints.Nuoya Xiong, Zhaoran Wang, Zhuoran Yang
2024ICMLHow Does Goal Relabeling Improve Sample Efficiency?Sirui Zheng, Chenjia Bai, Zhuoran Yang, Zhaoran Wang
2023AISTATSFinding Regularized Competitive Equilibria of Heterogeneous Agent Macroeconomic Models via Reinforcement Learning.Ruitu Xu, Yifei Min, Tianhao Wang, Michael I. Jordan, Zhaoran Wang, Zhuoran Yang
2023APNOMSProgress and Challenges of Polymorphic Smart Networks.Peixin Liu, Xiangyu Bai, Zhaoran Wang
2023COMPSACDeep Learning for Regional Subsidence Crisis Prediction in Smart Grid Infrastructure.Zhaoran Wang, Xiangyu Bai, Yu Han
2023ICLRRepresent to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency.Lingxiao Wang, Qi Cai, Zhuoran Yang, Zhaoran Wang
2023ICLRPessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes.Miao Lu, Yifei Min, Zhaoran Wang, Zhuoran Yang
2023ICLRLatent Variable Representation for Reinforcement Learning.Tongzheng Ren, Chenjun Xiao, Tianjun Zhang, Na Li, Zhaoran Wang, Sujay Sanghavi, Dale Schuurmans, Bo Dai
2023ICLROffline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization.Haoran Xu, Li Jiang, Jianxiong Li, Zhuoran Yang, Zhaoran Wang, Wai Kin Victor Chan, Xianyuan Zhan
2023ICLROptimistic Exploration with Learned Features Provably Solves Markov Decision Processes with Neural Dynamics.Sirui Zheng, Lingxiao Wang, Shuang Qiu, Zuyue Fu, Zhuoran Yang, Csaba Szepesvri, Zhaoran Wang
2023ICMLEnforcing Hard Constraints with Soft Barriers: Safe Reinforcement Learning in Unknown Stochastic Environments.Yixuan Wang, Simon Sinong Zhan, Ruochen Jiao, Zhilu Wang, Wanxin Jin, Zhuoran Yang, Zhaoran Wang, Chao Huang, Qi Zhu
2023ICMLLocal Optimization Achieves Global Optimality in Multi-Agent Reinforcement Learning.Yulai Zhao, Zhuoran Yang, Zhaoran Wang, Jason D. Lee
2023ICMLAchieving Hierarchy-Free Approximation for Bilevel Programs with Equilibrium Constraints.Jiayang Li, Jing Yu, Boyi Liu, Yu Marco Nie, Zhaoran Wang
2023ICMLAdaptive Barrier Smoothing for First-Order Policy Gradient with Contact Dynamics.Shenao Zhang, Wanxin Jin, Zhaoran Wang
2022AISTATSGap-Dependent Bounds for Two-Player Markov Games.Zehao Dou, Zhuoran Yang, Zhaoran Wang, Simon S. Du
2022DACDesign-while-verify: correct-by-construction control learning with verification in the loop.Yixuan Wang, Chao Huang, Zhaoran Wang, Zhilu Wang, Qi Zhu
2022ICLRPessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning.Chenjia Bai, Lingxiao Wang, Zhuoran Yang, Zhi-Hong Deng, Animesh Garg, Peng Liu, Zhaoran Wang
2022ICLRTowards General Function Approximation in Zero-Sum Markov Games.Baihe Huang, Jason D. Lee, Zhaoran Wang, Zhuoran Yang
2022ICMLReinforcement Learning from Partial Observation: Linear Function Approximation with Provable Sample Efficiency.Qi Cai, Zhuoran Yang, Zhaoran Wang
2022ICMLAdaptive Model Design for Markov Decision Process.Siyu Chen, Donglin Yang, Jiayang Li, Senmiao Wang, Zhuoran Yang, Zhaoran Wang
2022ICMLHuman-in-the-loop: Provably Efficient Preference-based Reinforcement Learning with General Function Approximation.Xiaoyu Chen, Han Zhong, Zhuoran Yang, Zhaoran Wang, Liwei Wang
2022ICMLProvably Efficient Offline Reinforcement Learning for Partially Observable Markov Decision Processes.Hongyi Guo, Qi Cai, Yufeng Zhang, Zhuoran Yang, Zhaoran Wang
2022ICMLWelfare Maximization in Competitive Equilibrium: Reinforcement Learning for Markov Exchange Economy.Zhihan Liu, Miao Lu, Zhaoran Wang, Michael I. Jordan, Zhuoran Yang
2022ICMLLearning from Demonstration: Provably Efficient Adversarial Policy Imitation with Linear Function Approximation.Zhihan Liu, Yufeng Zhang, Zuyue Fu, Zhuoran Yang, Zhaoran Wang
2022ICMLPessimism meets VCG: Learning Dynamic Mechanism Design via Offline Reinforcement Learning.Boxiang Lyu, Zhaoran Wang, Mladen Kolar, Zhuoran Yang
2022ICMLContrastive UCB: Provably Efficient Contrastive Self-Supervised Learning in Online Reinforcement Learning.Shuang Qiu, Lingxiao Wang, Chenjia Bai, Zhuoran Yang, Zhaoran Wang
2022ICMLPessimistic Minimax Value Iteration: Provably Efficient Equilibrium Learning from Offline Datasets.Han Zhong, Wei Xiong, Jiyuan Tan, Liwei Wang, Tong Zhang, Zhaoran Wang, Zhuoran Yang
2022SENSYSAccelerate online reinforcement learning for building HVAC control with heterogeneous expert guidances.Shichao Xu, Yangyang Fu, Yixuan Wang, Zhuoran Yang, Zheng O'Neill, Zhaoran Wang, Qi Zhu
2021AISTATSProvably Efficient Safe Exploration via Primal-Dual Policy Optimization.Dongsheng Ding, Xiaohan Wei, Zhuoran Yang, Zhaoran Wang, Mihailo R. Jovanovic
2021AISTATSSample Elicitation.Jiaheng Wei, Zuyue Fu, Yang Liu, Xingyu Li, Zhuoran Yang, Zhaoran Wang
2021AISTATSProvably Efficient Actor-Critic for Risk-Sensitive and Robust Adversarial RL: A Linear-Quadratic Case.Yufeng Zhang, Zhuoran Yang, Zhaoran Wang
2021DACCocktail: Learn a Better Neural Network Controller from Multiple Experts via Adaptive Mixing and Robust Distillation.Yixuan Wang, Chao Huang, Zhilu Wang, Shichao Xu, Zhaoran Wang, Qi Zhu
2021ICLRSingle-Timescale Actor-Critic Provably Finds Globally Optimal Policy.Zuyue Fu, Zhuoran Yang, Zhaoran Wang
2021ICMLPrincipled Exploration via Optimistic Bootstrapping and Backward Induction.Chenjia Bai, Lingxiao Wang, Lei Han, Jianye Hao, Animesh Garg, Peng Liu, Zhaoran Wang
2021ICMLRisk-Sensitive Reinforcement Learning with Function Approximation: A Debiasing Approach.Yingjie Fei, Zhuoran Yang, Zhaoran Wang
2021ICMLDecentralized Single-Timescale Actor-Critic on Zero-Sum Two-Player Stochastic Games.Hongyi Guo, Zuyue Fu, Zhuoran Yang, Zhaoran Wang
2021ICMLRandomized Exploration in Reinforcement Learning with General Value Function Approximation.Haque Ishfaq, Qiwen Cui, Viet Nguyen, Alex Ayoub, Zhuoran Yang, Zhaoran Wang, Doina Precup, Lin Yang
2021ICMLIs Pessimism Provably Efficient for Offline RL?Ying Jin, Zhuoran Yang, Zhaoran Wang
2021ICMLInfinite-Dimensional Optimization for Zero-Sum Games via Variational Transport.Lewis Liu, Yufeng Zhang, Zhuoran Yang, Reza Babanezhad, Zhaoran Wang
2021ICMLProvably Efficient Fictitious Play Policy Optimization for Zero-Sum Markov Games with Structured Transitions.Shuang Qiu, Xiaohan Wei, Jieping Ye, Zhaoran Wang, Zhuoran Yang
2021ICMLOn Reward-Free RL with Kernel and Neural Function Approximations: Single-Agent MDP and Markov Game.Shuang Qiu, Jieping Ye, Zhaoran Wang, Zhuoran Yang
2021ICMLGlobal Convergence of Policy Gradient for Linear-Quadratic Mean-Field Control/Game in Continuous Time.Weichen Wang, Jiequn Han, Zhuoran Yang, Zhaoran Wang
2021ICMLLearning While Playing in Mean-Field Games: Convergence and Optimality.Qiaomin Xie, Zhuoran Yang, Zhaoran Wang, Andreea Minca
2021ICMLDoubly Robust Off-Policy Actor-Critic: Convergence and Optimality.Tengyu Xu, Zhuoran Yang, Zhaoran Wang, Yingbin Liang
2021ISPATrajectory Privacy Protection Method based on Shadow vehicles.Yaqiong Ma, Xiangyu Bai, Zhaoran Wang
2020COLTProvably efficient reinforcement learning with linear function approximation.Chi Jin, Zhuoran Yang, Zhaoran Wang, Michael I. Jordan
2020COLTLearning Zero-Sum Simultaneous-Move Markov Games Using Function Approximation and Correlated Equilibrium.Qiaomin Xie, Yudong Chen, Zhaoran Wang, Zhuoran Yang
2020ICLROn Computation and Generalization of Generative Adversarial Imitation Learning.Minshuo Chen, Yizhou Wang, Tianyi Liu, Zhuoran Yang, Xingguo Li, Zhaoran Wang, Tuo Zhao
2020ICLRActor-Critic Provably Finds Nash Equilibria of Linear-Quadratic Mean-Field Games.Zuyue Fu, Zhuoran Yang, Yongxin Chen, Zhaoran Wang
2020ICLRNeural Policy Gradient Methods: Global Optimality and Rates of Convergence.Lingxiao Wang, Qi Cai, Zhuoran Yang, Zhaoran Wang
2020ICMLProvably Efficient Exploration in Policy Optimization.Qi Cai, Zhuoran Yang, Chi Jin, Zhaoran Wang
2020ICMLComputational and Statistical Tradeoffs in Inferring Combinatorial Structures of Ising Model.Ying Jin, Zhaoran Wang, Junwei Lu
2020ICMLSemiparametric Nonlinear Bipartite Graph Representation Learning with Provable Guarantees.Sen Na, Yuwei Luo, Zhuoran Yang, Zhaoran Wang, Mladen Kolar
2020ICMLDeep Reinforcement Learning with Robust and Smooth Policy.Qianli Shen, Yan Li, Haoming Jiang, Zhaoran Wang, Tuo Zhao
2020ICMLOn the Global Optimality of Model-Agnostic Meta-Learning.Lingxiao Wang, Qi Cai, Zhuoran Yang, Zhaoran Wang
2020ICMLBreaking the Curse of Many Agents: Provable Mean Embedding Q-Iteration for Mean-Field Reinforcement Learning.Lingxiao Wang, Zhuoran Yang, Zhaoran Wang
2020ICMLGenerative Adversarial Imitation Learning with Neural Network Parameterization: Global Optimality and Convergence Rate.Yufeng Zhang, Qi Cai, Zhuoran Yang, Zhaoran Wang
2019ICLRAccelerating Nonconvex Learning via Replica Exchange Langevin diffusion.Yi Chen, Jinglin Chen, Jing Dong, Jian Peng, Zhaoran Wang
2019ICLROff-Policy Evaluation and Learning from Logged Bandit Feedback: Error Reduction via Surrogate Policy.Yuan Xie, Boyi Liu, Qiang Liu, Zhaoran Wang, Yuan Zhou, Jian Peng
2019ICMLOn the statistical rate of nonlinear recovery in generative models with heavy-tailed data.Xiaohan Wei, Zhuoran Yang, Zhaoran Wang
2018AISTATSMinimax-Optimal Privacy-Preserving Sparse PCA in Distributed Systems.Jason Ge, Zhaoran Wang, Mengdi Wang, Han Liu
2018AISTATSNonlinear Structured Signal Estimation in High Dimensions via Iterative Hard Thresholding.Kaiqing Zhang, Zhuoran Yang, Zhaoran Wang
2018ICDMDynamic Truth Discovery on Numerical Data.Shi Zhi, Fan Yang, Zheyi Zhu, Qi Li, Zhaoran Wang, Jiawei Han
2018ICMLThe Edge Density Barrier: Computational-Statistical Tradeoffs in Combinatorial Inference.Hao Lu, Yuan Cao, Junwei Lu, Han Liu, Zhaoran Wang
2018ITASymmetry. Saddle Points, and Global Optimization Landscape of Nonconvex Matrix Factorization.Xingguo Li, Jarvis D. Haupt, Junwei Lu, Zhaoran Wang, Raman Arora, Han Liu, Tuo Zhao
2016AISTATSLow-Rank and Sparse Structure Pursuit via Alternating Minimization.Quanquan Gu, Zhaoran Wang, Han Liu
2016ICMLOn the Statistical Limits of Convex Relaxations.Zhaoran Wang, Quanquan Gu, Han Liu
2016ICMLSparse Nonlinear Regression: Parameter Estimation under Nonconvexity.Zhuoran Yang, Zhaoran Wang, Han Liu, Yonina C. Eldar, Tong Zhang
2016KDDA Truth Discovery Approach with Theoretical Guarantee.Houping Xiao, Jing Gao, Zhaoran Wang, Shiyu Wang, Lu Su, Han Liu
2013AISTATSSparse Principal Component Analysis for High Dimensional Multivariate Time Series.Zhaoran Wang, Fang Han, Han Liu