| 2025 | AAAI | Last-iterate Convergence in Regularized Graphon Mean Field Game. | Jing Dong, Baoxiang Wang, Yaoliang Yu |
| 2025 | AAAI | Logarithmic Regret for Linear Markov Decision Processes with Adversarial Corruptions. | Canzhe Zhao, Xiangcheng Zhang, Baoxiang Wang, Shuai Li |
| 2025 | AISTATS | Multi-Agent Credit Assignment with Pretrained Language Models. | Wenhao Li, Dan Qiao, Baoxiang Wang, Xiangfeng Wang, Wei Yin, Hao Shen, Bo Jin, Hongyuan Zha |
| 2025 | AISTATS | Learning to Negotiate via Voluntary Commitment. | Shuhui Zhu, Baoxiang Wang, Sriram Ganapathi Subramanian, Pascal Poupart |
| 2025 | ICLR | Learning to Communicate Through Implicit Communication Channels. | Han Wang, Binbin Chen, Tieying Zhang, Baoxiang Wang |
| 2025 | ICLR | Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling. | Jiawei Xu, Rui Yang, Shuang Qiu, Feng Luo, Meng Fang, Baoxiang Wang, Lei Han |
| 2025 | ICLR | The adaptive complexity of parallelized log-concave sampling. | Huanjian Zhou, Baoxiang Wang, Masashi Sugiyama |
| 2025 | ICLR | Improved Approximation Algorithms for k-Submodular Maximization via Multilinear Extension. | Huanjian Zhou, Lingxiao Huang, Baoxiang Wang |
| 2025 | ICML | Reward Translation via Reward Machine in Semi-Alignable MDPs. | Yun Hua, Haosheng Chen, Wenhao Li, Bo Jin, Baoxiang Wang, Hongyuan Zha, Xiangfeng Wang |
| 2025 | ICML | A Comprehensive Framework for Analyzing the Convergence of Adam: Bridging the Gap with SGD. | Ruinan Jin, Xiao Li, Yaoliang Yu, Baoxiang Wang |
| 2025 | ICML | Learning Imperfect Information Extensive-form Games with Last-iterate Convergence under Bandit Feedback. | Canzhe Zhao, Yutian Cheng, Jing Dong, Baoxiang Wang, Shuai Li |
| 2024 | AAAI | Relative Policy-Transition Optimization for Fast Policy Transfer. | Jiawei Xu, Cheng Zhou, Yizheng Zhang, Baoxiang Wang, Lei Han |
| 2024 | AISTATS | Convergence to Nash Equilibrium and No-regret Guarantee in (Markov) Potential Games. | Jing Dong, Baoxiang Wang, Yaoliang Yu |
| 2024 | ICLR | On Stationary Point Convergence of PPO-Clip. | Ruinan Jin, Shuai Li, Baoxiang Wang |
| 2024 | IJCAI | Carbon Market Simulation with Adaptive Mechanism Design. | Han Wang, Wenhao Li, Hongyuan Zha, Baoxiang Wang |
| 2024 | UAI | Online Policy Optimization for Robust Markov Decision Process. | Jing Dong, Jingwei Li, Baoxiang Wang, Jingzhao Zhang |
| 2023 | AAAI | Learning from Good Trajectories in Offline Multi-Agent Reinforcement Learning. | Qi Tian, Kun Kuang, Furui Liu, Baoxiang Wang |
| 2023 | ICLR | Learning Adversarial Linear Mixture Markov Decision Processes with Bandit Feedback and Unknown Transition. | Canzhe Zhao, Ruofeng Yang, Baoxiang Wang, Shuai Li |
| 2023 | IJCAI | DPMAC: Differentially Private Communication for Cooperative Multi-Agent Reinforcement Learning. | Canzhe Zhao, Yanjie Ze, Jing Dong, Baoxiang Wang, Shuai Li |
| 2023 | WSDM | Differentially Private Temporal Difference Learning with Stochastic Nonconvex-Strongly-Concave Optimization. | Canzhe Zhao, Yanjie Ze, Jing Dong, Baoxiang Wang, Shuai Li |
| 2022 | ICASSP | Cascading Bandit Under Differential Privacy. | Kun Wang, Jing Dong, Baoxiang Wang, Shuai Li |
| 2022 | ICML | Deconfounded Value Decomposition for Multi-Agent Reinforcement Learning. | Jiahui Li, Kun Kuang, Baoxiang Wang, Furui Liu, Long Chen, Changjie Fan, Fei Wu, Jun Xiao |
| 2022 | WSDM | Combinatorial Bandits under Strategic Manipulations. | Jing Dong, Ke Li, Shuai Li, Baoxiang Wang |
| 2021 | KDD | Shapley Counterfactual Credits for Multi-Agent Reinforcement Learning. | Jiahui Li, Kun Kuang, Baoxiang Wang, Furui Liu, Long Chen, Fei Wu, Jun Xiao |
| 2020 | ICLR | The Gambler's Problem and Beyond. | Baoxiang Wang, Shuai Li, Jiajin Li, Siu On Chan |
| 2019 | IJCAI | Recurrent Existence Determination Through Policy Optimization. | Baoxiang Wang |
| 2019 | IJCAI | Metatrace Actor-Critic: Online Step-Size Tuning by Meta-gradient Descent for Reinforcement Learning Control. | Kenny Young, Baoxiang Wang, Matthew E. Taylor |
| 2018 | ICLR | Policy Optimization with Second-Order Advantage Information. | Jiajin Li, Baoxiang Wang |
| 2018 | IJCAI | Policy Optimization with Second-Order Advantage Information. | Jiajin Li, Baoxiang Wang, Shengyu Zhang |
| 2016 | ICML | Contextual Combinatorial Cascading Bandits. | Shuai Li, Baoxiang Wang, Shengyu Zhang, Wei Chen |
| 2015 | ISSRE | PAID: Prioritizing app issues for developers by tracking user reviews over versions. | Cuiyun Gao, Baoxiang Wang, Pinjia He, Jieming Zhu, Yangfan Zhou, Michael R. Lyu |