Skip to content

Yuanheng Zhu

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

20

Venues

6

Active years

2012–2026

Best venue rank

A*

Where they publish

Papers

20 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLCriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic.Yaocheng Zhang, Haohuan Huang, Zijun Song, Zijie Zhao, Qichao Zhang, Yuanheng Zhu, Dongbin Zhao
2025EMNLPRLAE: Reinforcement Learning-Assisted Ensemble for LLMs.Yuqian Fu, Yuanheng Zhu, Jiajun Chai, Guojun Yin, Wei Lin, Qichao Zhang, Dongbin Zhao
2025ICLREmpowering LLM Agents with Zero-Shot Optimal Decision-Making through Q-learning.Jiajun Chai, Sicheng Li, Yuqian Fu, Dongbin Zhao, Yuanheng Zhu
2025ICLRINS: Interaction-aware Synthesis to Enhance Offline Multi-agent Reinforcement Learning.Yuqian Fu, Yuanheng Zhu, Jian Zhao, Jiajun Chai, Dongbin Zhao
2025ICLRDivergence-Regularized Discounted Aggregation: Equilibrium Finding in Multiplayer Partially Observable Stochastic Games.Runyu Lu, Yuanheng Zhu, Dongbin Zhao
2025ICMLConstrained Exploitability Descent: An Offline Reinforcement Learning Method for Finding Mixed-Strategy Nash Equilibrium.Runyu Lu, Yuanheng Zhu, Dongbin Zhao
2025ICMLDipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy.Kaixuan Xu, Jiajun Chai, Sicheng Li, Yuqian Fu, Yuanheng Zhu, Dongbin Zhao
2023ICONIPPolicy Representation Opponent Shaping via Contrastive Learning.Yuming Chen, Yuanheng Zhu
2023IJCNNNeuronsMAE: A Novel Multi-Agent Reinforcement Learning Environment for Cooperative and Competitive Multi-Robot Tasks.Guangzheng Hu, Haoran Li, Shasha Liu, Yuanheng Zhu, Dongbin Zhao
2023IJCNNAdvantage Constrained Proximal Policy Optimization in Multi-Agent Reinforcement Learning.Weifan Li, Yuanheng Zhu, Dongbin Zhao
2020IJCNNAn Improved Minimax-Q Algorithm Based on Generalized Policy Iteration to Solve a Chaser-Invader Game.Minsong Liu, Yuanheng Zhu, Dongbin Zhao
2020IJCNNCooperative Multi-Agent Deep Reinforcement Learning with Counterfactual Reward.Kun Shao, Yuanheng Zhu, Zhentao Tang, Dongbin Zhao
2019IJCNNOptimal Pedestrian Evacuation in Building with Consecutive Differential Dynamic Programming.Yuanheng Zhu, Haibo He, Dongbin Zhao, Zhongsheng Hou
2018ICONIPDriving Control with Deep and Reinforcement Learning in The Open Racing Car Simulator.Yuanheng Zhu, Dongbin Zhao
2018IJCNNVisual Navigation with Actor-Critic Deep Reinforcement Learning.Kun Shao, Dongbin Zhao, Yuanheng Zhu, Qichao Zhang
2016IJCNNModel-free reinforcement learning for nonlinear zero-sum games with simultaneous explorations.Qichao Zhang, Dongbin Zhao, Yuanheng Zhu, Xi Chen
2016IJCNNConvolutional fitted Q iteration for vision-based control problems.Dongbin Zhao, Yuanheng Zhu, Le Lv, Yaran Chen, Qichao Zhang
2015IJCNNThermal comfort control based on MEC algorithm for HVAC systems.Dong Li, Dongbin Zhao, Yuanheng Zhu, Zhongpu Xia
2013ICONIPOnline Model-Free RLSPI Algorithm for Nonlinear Discrete-Time Non-affine Systems.Yuanheng Zhu, Dongbin Zhao
2012IJCNNNeural and fuzzy dynamic programming for under-actuated systems.Dongbin Zhao, Yuanheng Zhu, Haibo He