Skip to content

Zhuoran Yang

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

77

Venues

7

Active years

2016–2026

Best venue rank

A*

Where they publish

Papers

77 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLProbing Audio-Visual Reasoning in Multimodal Language Models through the Lens of Audio.Kaixiong Gong, Kaituo Feng, Bohao Li, Yibing Wang, Mofan Cheng, Shijia Yang, Jiaming Han, Benyou Wang, Yutong Bai, Zhuoran Yang, Xiangyu Yue
2025ACLLearning Task Representations from In-Context Learning.Baturay Saglam, Xinyang Hu, Zhuoran Yang, Dionysis Kalogerias, Amin Karbasi
2025AISTATSWhat and How does In-Context Learning Learn? Bayesian Model Averaging, Parameterization, and Generalization.Yufeng Zhang, Fengzhuo Zhang, Zhuoran Yang, Zhaoran Wang
2025ICCVInstaDrive: Instance-Aware Driving World Models for Realistic and Consistent Video Generation.Zhuoran Yang, Xi Guo, Chenjing Ding, Chiyu Wang, Wei Wu, Yanyong Zhang
2025ICLRCan Neural Networks Achieve Optimal Computational-statistical Tradeoff? An Analysis on Single-Index Model.Siyu Chen, Beining Wu, Miao Lu, Zhuoran Yang, Tianhao Wang
2025ICMLBanditSpec: Adaptive Speculative Decoding via Bandit Algorithms.Yunlong Hou, Fengzhuo Zhang, Cunxiao Du, Xuan Zhang, Jiachun Pan, Tianyu Pang, Chao Du, Vincent Y. F. Tan, Zhuoran Yang
2025ICMLAn Instrumental Value for Data Production and its Application to Data Pricing.Rui Ai, Boxiang Lyu, Zhaoran Wang, Zhuoran Yang, Haifeng Xu
2025ICMLIn-Context Reinforcement Learning From Suboptimal Historical Data.Juncheng Dong, Moyang Guo, Ethan X. Fang, Zhuoran Yang, Vahid Tarokh
2025ICMLIn-Context Linear Regression Demystified: Training Dynamics and Mechanistic Interpretability of Multi-Head Softmax Attention.Jianliang He, Xintian Pan, Siyu Chen, Zhuoran Yang
2025ICMLThe Sample Complexity of Online Strategic Decision Making with Information Asymmetry and Knowledge Transportability.Jiachen Hu, Rui Ai, Han Zhong, Xiaoyu Chen, Liwei Wang, Zhaoran Wang, Zhuoran Yang
2025ICMLDecoding Rewards in Competitive Games: Inverse Game Theory with Entropy Regularization.Junyi Liao, Zihan Zhu, Ethan X. Fang, Zhuoran Yang, Vahid Tarokh
2024COLTTraining Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality (extended abstract).Siyu Chen, Heejune Sheen, Tianhao Wang, Zhuoran Yang
2024ICLRSample-efficient Learning of Infinite-horizon Average-reward MDPs with General Function Approximation.Jianliang He, Han Zhong, Zhuoran Yang
2024ICLRSymmetric Mean-field Langevin Dynamics for Distributional Minimax Problems.Juno Kim, Kakei Yamamoto, Kazusato Oko, Zhuoran Yang, Taiji Suzuki
2024ICLRSample-Efficient Multi-Agent RL: An Optimization Perspective.Nuoya Xiong, Zhihan Liu, Zhaoran Wang, Zhuoran Yang
2024ICMLTheory of Consistency Diffusion Models: Distribution Estimation Meets Fast Sampling.Zehao Dou, Minshuo Chen, Mengdi Wang, Zhuoran Yang
2024ICMLFrom Words to Actions: Unveiling the Theoretical Underpinnings of LLM-Driven Autonomous Systems.Jianliang He, Siyu Chen, Fengzhuo Zhang, Zhuoran Yang
2024ICMLPrincipled Penalty-based Methods for Bilevel Reinforcement Learning and RLHF.Han Shen, Zhuoran Yang, Tianyi Chen
2024ICMLA General Framework for Sequential Decision-Making under Adaptivity Constraints.Nuoya Xiong, Zhaoran Wang, Zhuoran Yang
2024ICMLMean Field Langevin Actor-Critic: Faster Convergence and Global Optimality beyond Lazy Learning.Kakei Yamamoto, Kazusato Oko, Zhuoran Yang, Taiji Suzuki
2024ICMLHow Does Goal Relabeling Improve Sample Efficiency?Sirui Zheng, Chenjia Bai, Zhuoran Yang, Zhaoran Wang
2023AISTATSFinding Regularized Competitive Equilibria of Heterogeneous Agent Macroeconomic Models via Reinforcement Learning.Ruitu Xu, Yifei Min, Tianhao Wang, Michael I. Jordan, Zhaoran Wang, Zhuoran Yang
2023ICLRRepresent to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency.Lingxiao Wang, Qi Cai, Zhuoran Yang, Zhaoran Wang
2023ICLRPessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes.Miao Lu, Yifei Min, Zhaoran Wang, Zhuoran Yang
2023ICLRCan We Find Nash Equilibria at a Linear Rate in Markov Games?Zhuoqing Song, Jason D. Lee, Zhuoran Yang
2023ICLROffline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization.Haoran Xu, Li Jiang, Jianxiong Li, Zhuoran Yang, Zhaoran Wang, Wai Kin Victor Chan, Xianyuan Zhan
2023ICLRDecentralized Optimistic Hyperpolicy Mirror Descent: Provably No-Regret Learning in Markov Games.Wenhao Zhan, Jason D. Lee, Zhuoran Yang
2023ICLROptimistic Exploration with Learned Features Provably Solves Markov Decision Processes with Neural Dynamics.Sirui Zheng, Lingxiao Wang, Shuang Qiu, Zuyue Fu, Zhuoran Yang, Csaba Szepesvri, Zhaoran Wang
2023ICMLEnforcing Hard Constraints with Soft Barriers: Safe Reinforcement Learning in Unknown Stochastic Environments.Yixuan Wang, Simon Sinong Zhan, Ruochen Jiao, Zhilu Wang, Wanxin Jin, Zhuoran Yang, Zhaoran Wang, Chao Huang, Qi Zhu
2023ICMLLocal Optimization Achieves Global Optimality in Multi-Agent Reinforcement Learning.Yulai Zhao, Zhuoran Yang, Zhaoran Wang, Jason D. Lee
2023ICMLLearning to Incentivize Information Acquisition: Proper Scoring Rules Meet Principal-Agent Model.Siyu Chen, Jibang Wu, Yifan Wu, Zhuoran Yang
2023ICMLProvably Efficient Representation Learning with Tractable Planning in Low-Rank POMDP.Jiacheng Guo, Zihao Li, Huazheng Wang, Mengdi Wang, Zhuoran Yang, Xuezhou Zhang
2022AISTATSGap-Dependent Bounds for Two-Player Markov Games.Zehao Dou, Zhuoran Yang, Zhaoran Wang, Simon S. Du
2022ICLRPessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning.Chenjia Bai, Lingxiao Wang, Zhuoran Yang, Zhi-Hong Deng, Animesh Garg, Peng Liu, Zhaoran Wang
2022ICLRTowards General Function Approximation in Zero-Sum Markov Games.Baihe Huang, Jason D. Lee, Zhaoran Wang, Zhuoran Yang
2022ICLRReinforcement Learning under a Multi-agent Predictive State Representation Model: Method and Theory.Zhi Zhang, Zhuoran Yang, Han Liu, Pratap Tokekar, Furong Huang
2022ICMLReinforcement Learning from Partial Observation: Linear Function Approximation with Provable Sample Efficiency.Qi Cai, Zhuoran Yang, Zhaoran Wang
2022ICMLAdaptive Model Design for Markov Decision Process.Siyu Chen, Donglin Yang, Jiayang Li, Senmiao Wang, Zhuoran Yang, Zhaoran Wang
2022ICMLHuman-in-the-loop: Provably Efficient Preference-based Reinforcement Learning with General Function Approximation.Xiaoyu Chen, Han Zhong, Zhuoran Yang, Zhaoran Wang, Liwei Wang
2022ICMLProvably Efficient Offline Reinforcement Learning for Partially Observable Markov Decision Processes.Hongyi Guo, Qi Cai, Yufeng Zhang, Zhuoran Yang, Zhaoran Wang
2022ICMLWelfare Maximization in Competitive Equilibrium: Reinforcement Learning for Markov Exchange Economy.Zhihan Liu, Miao Lu, Zhaoran Wang, Michael I. Jordan, Zhuoran Yang
2022ICMLLearning from Demonstration: Provably Efficient Adversarial Policy Imitation with Linear Function Approximation.Zhihan Liu, Yufeng Zhang, Zuyue Fu, Zhuoran Yang, Zhaoran Wang
2022ICMLPessimism meets VCG: Learning Dynamic Mechanism Design via Offline Reinforcement Learning.Boxiang Lyu, Zhaoran Wang, Mladen Kolar, Zhuoran Yang
2022ICMLContrastive UCB: Provably Efficient Contrastive Self-Supervised Learning in Online Reinforcement Learning.Shuang Qiu, Lingxiao Wang, Chenjia Bai, Zhuoran Yang, Zhaoran Wang
2022ICMLPessimistic Minimax Value Iteration: Provably Efficient Equilibrium Learning from Offline Datasets.Han Zhong, Wei Xiong, Jiyuan Tan, Liwei Wang, Tong Zhang, Zhaoran Wang, Zhuoran Yang
2022SENSYSAccelerate online reinforcement learning for building HVAC control with heterogeneous expert guidances.Shichao Xu, Yangyang Fu, Yixuan Wang, Zhuoran Yang, Zheng O'Neill, Zhaoran Wang, Qi Zhu
2021AISTATSProvably Efficient Safe Exploration via Primal-Dual Policy Optimization.Dongsheng Ding, Xiaohan Wei, Zhuoran Yang, Zhaoran Wang, Mihailo R. Jovanovic
2021AISTATSSample Elicitation.Jiaheng Wei, Zuyue Fu, Yang Liu, Xingyu Li, Zhuoran Yang, Zhaoran Wang
2021AISTATSProvably Efficient Actor-Critic for Risk-Sensitive and Robust Adversarial RL: A Linear-Quadratic Case.Yufeng Zhang, Zhuoran Yang, Zhaoran Wang
2021ICLRSingle-Timescale Actor-Critic Provably Finds Globally Optimal Policy.Zuyue Fu, Zhuoran Yang, Zhaoran Wang
2021ICMLRisk-Sensitive Reinforcement Learning with Function Approximation: A Debiasing Approach.Yingjie Fei, Zhuoran Yang, Zhaoran Wang
2021ICMLDecentralized Single-Timescale Actor-Critic on Zero-Sum Two-Player Stochastic Games.Hongyi Guo, Zuyue Fu, Zhuoran Yang, Zhaoran Wang
2021ICMLRandomized Exploration in Reinforcement Learning with General Value Function Approximation.Haque Ishfaq, Qiwen Cui, Viet Nguyen, Alex Ayoub, Zhuoran Yang, Zhaoran Wang, Doina Precup, Lin Yang
2021ICMLIs Pessimism Provably Efficient for Offline RL?Ying Jin, Zhuoran Yang, Zhaoran Wang
2021ICMLInfinite-Dimensional Optimization for Zero-Sum Games via Variational Transport.Lewis Liu, Yufeng Zhang, Zhuoran Yang, Reza Babanezhad, Zhaoran Wang
2021ICMLProvably Efficient Fictitious Play Policy Optimization for Zero-Sum Markov Games with Structured Transitions.Shuang Qiu, Xiaohan Wei, Jieping Ye, Zhaoran Wang, Zhuoran Yang
2021ICMLOn Reward-Free RL with Kernel and Neural Function Approximations: Single-Agent MDP and Markov Game.Shuang Qiu, Jieping Ye, Zhaoran Wang, Zhuoran Yang
2021ICMLReinforcement Learning for Cost-Aware Markov Decision Processes.Wesley Suttle, Kaiqing Zhang, Zhuoran Yang, Ji Liu, David N. Kraemer
2021ICMLGlobal Convergence of Policy Gradient for Linear-Quadratic Mean-Field Control/Game in Continuous Time.Weichen Wang, Jiequn Han, Zhuoran Yang, Zhaoran Wang
2021ICMLLearning While Playing in Mean-Field Games: Convergence and Optimality.Qiaomin Xie, Zhuoran Yang, Zhaoran Wang, Andreea Minca
2021ICMLDoubly Robust Off-Policy Actor-Critic: Convergence and Optimality.Tengyu Xu, Zhuoran Yang, Zhaoran Wang, Yingbin Liang
2020COLTProvably efficient reinforcement learning with linear function approximation.Chi Jin, Zhuoran Yang, Zhaoran Wang, Michael I. Jordan
2020COLTLearning Zero-Sum Simultaneous-Move Markov Games Using Function Approximation and Correlated Equilibrium.Qiaomin Xie, Yudong Chen, Zhaoran Wang, Zhuoran Yang
2020ICLROn Computation and Generalization of Generative Adversarial Imitation Learning.Minshuo Chen, Yizhou Wang, Tianyi Liu, Zhuoran Yang, Xingguo Li, Zhaoran Wang, Tuo Zhao
2020ICLRActor-Critic Provably Finds Nash Equilibria of Linear-Quadratic Mean-Field Games.Zuyue Fu, Zhuoran Yang, Yongxin Chen, Zhaoran Wang
2020ICLRNeural Policy Gradient Methods: Global Optimality and Rates of Convergence.Lingxiao Wang, Qi Cai, Zhuoran Yang, Zhaoran Wang
2020ICMLProvably Efficient Exploration in Policy Optimization.Qi Cai, Zhuoran Yang, Chi Jin, Zhaoran Wang
2020ICMLSemiparametric Nonlinear Bipartite Graph Representation Learning with Provable Guarantees.Sen Na, Yuwei Luo, Zhuoran Yang, Zhaoran Wang, Mladen Kolar
2020ICMLRobust One-Bit Recovery via ReLU Generative Networks: Near-Optimal Statistical Rate and Global Landscape Analysis.Shuang Qiu, Xiaohan Wei, Zhuoran Yang
2020ICMLOn the Global Optimality of Model-Agnostic Meta-Learning.Lingxiao Wang, Qi Cai, Zhuoran Yang, Zhaoran Wang
2020ICMLBreaking the Curse of Many Agents: Provable Mean Embedding Q-Iteration for Mean-Field Reinforcement Learning.Lingxiao Wang, Zhuoran Yang, Zhaoran Wang
2020ICMLGenerative Adversarial Imitation Learning with Neural Network Parameterization: Global Optimality and Convergence Rate.Yufeng Zhang, Qi Cai, Zhuoran Yang, Zhaoran Wang
2019ICMLOn the statistical rate of nonlinear recovery in generative models with heavy-tailed data.Xiaohan Wei, Zhuoran Yang, Zhaoran Wang
2018AISTATSNonlinear Structured Signal Estimation in High Dimensions via Iterative Hard Thresholding.Kaiqing Zhang, Zhuoran Yang, Zhaoran Wang
2018ICMLFully Decentralized Multi-Agent Reinforcement Learning with Networked Agents.Kaiqing Zhang, Zhuoran Yang, Han Liu, Tong Zhang, Tamer Basar
2017ICMLHigh-dimensional Non-Gaussian Single Index Models via Thresholded Score Function Estimation.Zhuoran Yang, Krishnakumar Balasubramanian, Han Liu
2016ICMLSparse Nonlinear Regression: Parameter Estimation under Nonconvexity.Zhuoran Yang, Zhaoran Wang, Han Liu, Yonina C. Eldar, Tong Zhang