| 2026 | ACL | CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic. | Yaocheng Zhang, Haohuan Huang, Zijun Song, Zijie Zhao, Qichao Zhang, Yuanheng Zhu, Dongbin Zhao |
| 2025 | EMNLP | RLAE: Reinforcement Learning-Assisted Ensemble for LLMs. | Yuqian Fu, Yuanheng Zhu, Jiajun Chai, Guojun Yin, Wei Lin, Qichao Zhang, Dongbin Zhao |
| 2025 | ICLR | Empowering LLM Agents with Zero-Shot Optimal Decision-Making through Q-learning. | Jiajun Chai, Sicheng Li, Yuqian Fu, Dongbin Zhao, Yuanheng Zhu |
| 2025 | ICLR | INS: Interaction-aware Synthesis to Enhance Offline Multi-agent Reinforcement Learning. | Yuqian Fu, Yuanheng Zhu, Jian Zhao, Jiajun Chai, Dongbin Zhao |
| 2025 | ICLR | Divergence-Regularized Discounted Aggregation: Equilibrium Finding in Multiplayer Partially Observable Stochastic Games. | Runyu Lu, Yuanheng Zhu, Dongbin Zhao |
| 2025 | ICML | Constrained Exploitability Descent: An Offline Reinforcement Learning Method for Finding Mixed-Strategy Nash Equilibrium. | Runyu Lu, Yuanheng Zhu, Dongbin Zhao |
| 2025 | ICML | DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy. | Kaixuan Xu, Jiajun Chai, Sicheng Li, Yuqian Fu, Yuanheng Zhu, Dongbin Zhao |
| 2023 | ICONIP | Policy Representation Opponent Shaping via Contrastive Learning. | Yuming Chen, Yuanheng Zhu |
| 2023 | IJCNN | NeuronsMAE: A Novel Multi-Agent Reinforcement Learning Environment for Cooperative and Competitive Multi-Robot Tasks. | Guangzheng Hu, Haoran Li, Shasha Liu, Yuanheng Zhu, Dongbin Zhao |
| 2023 | IJCNN | Advantage Constrained Proximal Policy Optimization in Multi-Agent Reinforcement Learning. | Weifan Li, Yuanheng Zhu, Dongbin Zhao |
| 2020 | IJCNN | An Improved Minimax-Q Algorithm Based on Generalized Policy Iteration to Solve a Chaser-Invader Game. | Minsong Liu, Yuanheng Zhu, Dongbin Zhao |
| 2020 | IJCNN | Cooperative Multi-Agent Deep Reinforcement Learning with Counterfactual Reward. | Kun Shao, Yuanheng Zhu, Zhentao Tang, Dongbin Zhao |
| 2019 | IJCNN | Optimal Pedestrian Evacuation in Building with Consecutive Differential Dynamic Programming. | Yuanheng Zhu, Haibo He, Dongbin Zhao, Zhongsheng Hou |
| 2018 | ICONIP | Driving Control with Deep and Reinforcement Learning in The Open Racing Car Simulator. | Yuanheng Zhu, Dongbin Zhao |
| 2018 | IJCNN | Visual Navigation with Actor-Critic Deep Reinforcement Learning. | Kun Shao, Dongbin Zhao, Yuanheng Zhu, Qichao Zhang |
| 2016 | IJCNN | Model-free reinforcement learning for nonlinear zero-sum games with simultaneous explorations. | Qichao Zhang, Dongbin Zhao, Yuanheng Zhu, Xi Chen |
| 2016 | IJCNN | Convolutional fitted Q iteration for vision-based control problems. | Dongbin Zhao, Yuanheng Zhu, Le Lv, Yaran Chen, Qichao Zhang |
| 2015 | IJCNN | Thermal comfort control based on MEC algorithm for HVAC systems. | Dong Li, Dongbin Zhao, Yuanheng Zhu, Zhongpu Xia |
| 2013 | ICONIP | Online Model-Free RLSPI Algorithm for Nonlinear Discrete-Time Non-affine Systems. | Yuanheng Zhu, Dongbin Zhao |
| 2012 | IJCNN | Neural and fuzzy dynamic programming for under-actuated systems. | Dongbin Zhao, Yuanheng Zhu, Haibo He |