| 2026 | AAAI | Multi-agent In-context Coordination via Decentralized Memory Retrieval. | Tao Jiang, Zichuan Lin, Lihe Li, Yi-Chen Li, Cong Guan, Lei Yuan, Zongzhang Zhang, Yang Yu, Deheng Ye |
| 2026 | AAAI | Efficient Preference Alignment via Pareto Exploration (Student Abstract). | Pengfei Liu, Rui Kong, Zongzhang Zhang |
| 2026 | AAAI | Meta-Normalizing Flow for Data-Limited Offline Meta-Reinforcement Learning (Student Abstract). | Lianghui Liu, Zongzhang Zhang |
| 2026 | AAAI | Reward Model Evaluation via Automatically-Ranked Policy Alignment. | Aoran Wang, Lei Ou, Yang Yu, Zongzhang Zhang |
| 2025 | ACL | Lost in the Context: Insufficient and Distracted Attention to Contexts in Preference Modeling. | Shihan Dou, Jiayi Chen, Chenhao Huang, Feng Chen, Wei Chengzhi, Huiyuan Zheng, Shichun Liu, Yan Liu, Chenxiao Liu, Chao Xin, Lin Yan, Zongzhang Zhang, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | ICLR | Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation. | Yi-Chen Li, Fuxiang Zhang, Wenjie Qiu, Lei Yuan, Chengxing Jia, Zongzhang Zhang, Yang Yu, Bo An |
| 2025 | ICML | Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning. | Chen-Xiao Gao, Chenyang Wu, Mingjun Cao, Chenjun Xiao, Yang Yu, Zongzhang Zhang |
| 2025 | IJCAI | Reinforced In-Context Black-Box Optimization. | Lei Song, Chen-Xiao Gao, Ke Xue, Chenyang Wu, Dong Li, Jianye Hao, Zongzhang Zhang, Chao Qian |
| 2025 | IJCAI | Reward Models in Deep Reinforcement Learning: A Survey. | Rui Yu, Shenghua Wan, Yucen Wang, Chen-Xiao Gao, Le Gan, Zongzhang Zhang, De-Chuan Zhan |
| 2024 | AAAI | Focus-Then-Decide: Segmentation-Assisted Reinforcement Learning. | Chao Chen, Jiacheng Xu, Weijian Liao, Hao Ding, Zongzhang Zhang, Yang Yu, Rui Zhao |
| 2024 | AAAI | ACT: Empowering Decision Transformer with Dynamic Programming via Advantage Conditioning. | Chenxiao Gao, Chenyang Wu, Mingjun Cao, Rui Kong, Zongzhang Zhang, Yang Yu |
| 2024 | AAAI | Generalizable Policy Improvement via Reinforcement Sampling (Student Abstract). | Rui Kong, Chenyang Wu, Zongzhang Zhang |
| 2024 | AAAI | Generalizable Task Representation Learning for Offline Meta-Reinforcement Learning with Data Limitations. | Renzhe Zhou, Chenxiao Gao, Zongzhang Zhang, Yang Yu |
| 2024 | AAAI | Multi-Expert Distillation for Few-Shot Coordination (Student Abstract). | Yujian Zhu, Hao Ding, Zongzhang Zhang |
| 2024 | ICLR | Attention-Guided Contrastive Role Representations for Multi-agent Reinforcement Learning. | Zican Hu, Zongzhang Zhang, Huaxiong Li, Chunlin Chen, Hongyu Ding, Zhi Wang |
| 2024 | ICLR | Policy Rehearsing: Training Generalizable Policies for Reinforcement Learning. | Chengxing Jia, Chenxiao Gao, Hao Yin, Fuxiang Zhang, Xiong-Hui Chen, Tian Xu, Lei Yuan, Zongzhang Zhang, Zhi-Hua Zhou, Yang Yu |
| 2024 | ICLR | Language Model Self-improvement by Reinforcement Learning Contemplation. | Jing-Cheng Pang, Pengyuan Wang, Kaiyuan Li, Xiong-Hui Chen, Jiacheng Xu, Zongzhang Zhang, Yang Yu |
| 2024 | ICML | Deep Demonstration Tracing: Learning Generalizable Imitator Policy for Runtime Imitation from a Single Demonstration. | Xiong-Hui Chen, Junyin Ye, Hang Zhao, Yi-Chen Li, XuHui Liu, Haoran Shi, Yu-Yan Xu, Zhihao Ye, Si-Hang Yang, Yang Yu, Anqi Huang, Kai Xu, Zongzhang Zhang |
| 2024 | ICML | Debiased Offline Representation Learning for Fast Online Adaptation in Non-stationary Dynamics. | Xinyu Zhang, Wenjie Qiu, Yi-Chen Li, Lei Yuan, Chengxing Jia, Zongzhang Zhang, Yang Yu |
| 2024 | IJCAI | Efficient and Stable Offline-to-online Reinforcement Learning via Continual Policy Revitalization. | Rui Kong, Chenyang Wu, Chen-Xiao Gao, Zongzhang Zhang, Ming Li |
| 2023 | AAAI | Deep Anomaly Detection and Search via Reinforcement Learning (Student Abstract). | Chao Chen, Dawei Wang, Feng Mao, Zongzhang Zhang, Yang Yu |
| 2023 | AAAI | Towards Deployment-Efficient and Collision-Free Multi-Agent Path Finding (Student Abstract). | Feng Chen, Chenghe Wang, Fuxiang Zhang, Hao Ding, Qiaoyong Zhong, Shiliang Pu, Zongzhang Zhang |
| 2023 | AAAI | Expert Data Augmentation in Imitation Learning (Student Abstract). | Fuguang Han, Zongzhang Zhang |
| 2023 | AAAI | Policy-Independent Behavioral Metric-Based Representation for Deep Reinforcement Learning. | Weijian Liao, Zongzhang Zhang, Yang Yu |
| 2023 | AAAI | Learning Generalizable Batch Active Learning Strategies via Deep Q-networks (Student Abstract). | Yi-Chen Li, Wen-Jie Shen, Boyu Zhang, Feng Mao, Zongzhang Zhang, Yang Yu |
| 2023 | AAAI | Anti-drifting Feature Selection via Deep Reinforcement Learning (Student Abstract). | Aoran Wang, Hongyang Yang, Feng Mao, Zongzhang Zhang, Yang Yu, Xiaoyang Liu |
| 2023 | AAAI | Model-Based Offline Weighted Policy Optimization (Student Abstract). | Renzhe Zhou, Zongzhang Zhang, Yang Yu |
| 2023 | ICLR | Discovering Generalizable Multi-agent Coordination Skills from Multi-task Offline Data. | Fuxiang Zhang, Chengxing Jia, Yi-Chen Li, Lei Yuan, Yang Yu, Zongzhang Zhang |
| 2023 | ICML | Retrosynthetic Planning with Dual Value Networks. | Guoqing Liu, Di Xue, Shufang Xie, Yingce Xia, Austin Tripp, Krzysztof Maziarz, Marwin H. S. Segler, Tao Qin, Zongzhang Zhang, Tie-Yan Liu |
| 2023 | ICML | Policy Regularization with Dataset Constraint for Offline Reinforcement Learning. | Yuhang Ran, Yi-Chen Li, Fuxiang Zhang, Zongzhang Zhang, Yang Yu |
| 2023 | KDD | Internal Logical Induction for Pixel-Symbolic Reinforcement Learning. | Jiacheng Xu, Chao Chen, Fuxiang Zhang, Lei Yuan, Zongzhang Zhang, Yang Yu |
| 2022 | AAAI | Adapt to Environment Sudden Changes by Learning a Context Sensitive Policy. | Fan-Ming Luo, Shengyi Jiang, Yang Yu, Zongzhang Zhang, Yi-Feng Zhang |
| 2022 | AAAI | Multi-Agent Incentive Communication via Decentralized Teammate Modeling. | Lei Yuan, Jianhao Wang, Fuxiang Zhang, Chenghe Wang, Zongzhang Zhang, Yang Yu, Chongjie Zhang |
| 2022 | IJCAI | Efficient Multi-Agent Communication via Shapley Message Value. | Di Xue, Lei Yuan, Zongzhang Zhang, Yang Yu |
| 2022 | IJCAI | Multi-Agent Concentrative Coordination with Decentralized Task Representation. | Lei Yuan, Chenghe Wang, Jianhao Wang, Fuxiang Zhang, Feng Chen, Cong Guan, Zongzhang Zhang, Chongjie Zhang, Yang Yu |
| 2021 | AAAI | LB-DESPOT: Efficient Online POMDP Planning Considering Lower Bound in Action Selection (Student Abstract). | Chenyang Wu, Rui Kong, Guoyu Yang, Xianghan Kong, Zongzhang Zhang, Yang Yu, Dong Li, Wulong Liu |
| 2021 | AAAI | Enhancing Context-Based Meta-Reinforcement Learning Algorithms via An Efficient Task Encoder (Student Abstract). | Feng Xu, Shengyi Jiang, Hao Yin, Zongzhang Zhang, Yang Yu, Ming Li, Dong Li, Wulong Liu |
| 2020 | AAAI | Third-Person Imitation Learning via Image Difference and Variational Discriminator Bottleneck (Student Abstract). | Chong Jiang, Zongzhang Zhang, Zixuan Chen, Jiacheng Zhu, Junpeng Jiang |
| 2020 | AAAI | Generative Adversarial Imitation Learning from Failed Experiences (Student Abstract). | Jiacheng Zhu, Jiahao Lin, Meng Wang, Yingfeng Chen, Changjie Fan, Chong Jiang, Zongzhang Zhang |
| 2020 | ICONIP | Recency-Weighted Acceleration for Continuous Control Through Deep Reinforcement Learning. | Zhen Wu, Zongzhang Zhang, Xiaofang Zhang |
| 2020 | ICONIP | Double Replay Buffers with Restricted Gradient. | Linjing Zhang, Zongzhang Zhang |
| 2020 | IJCAI | Triple-GAIL: A Multi-Modal Imitation Learning Framework with Generative Adversarial Nets. | Cong Fei, Bin Wang, Yuzheng Zhuang, Zongzhang Zhang, Jianye Hao, Hongbo Zhang, Xuewu Ji, Wulong Liu |
| 2020 | IJCAI | Efficient Deep Reinforcement Learning via Adaptive Policy Transfer. | Tianpei Yang, Jianye Hao, Zhaopeng Meng, Zongzhang Zhang, Yujing Hu, Yingfeng Chen, Changjie Fan, Weixun Wang, Wulong Liu, Zhaodong Wang, Jiajie Peng |
| 2019 | ICANN | Deep Recurrent Policy Networks for Planning Under Partial Observability. | Zixuan Chen, Zongzhang Zhang |
| 2019 | IJCAI | Monte Carlo Tree Search for Policy Optimization. | Xiaobai Ma, Katherine Rose Driggs-Campbell, Zongzhang Zhang, Mykel J. Kochenderfer |
| 2019 | ICTAI | Experience Selection in Multi-agent Deep Reinforcement Learning. | Yishen Wang, Zongzhang Zhang |
| 2018 | ICONIP | Asynchronous Value Iteration Network. | Zhiyuan Pan, Zongzhang Zhang, Zixuan Chen |
| 2018 | PRICAI | ACGAIL: Imitation Learning About Multiple Intentions with Auxiliary Classifier GANs. | Jiahao Lin, Zongzhang Zhang |
| 2018 | PRICAI | Weighted Double Deep Multiagent Reinforcement Learning in Stochastic Cooperative Environments. | Yan Zheng, Zhaopeng Meng, Jianye Hao, Zongzhang Zhang |
| 2017 | IJCAI | Weighted Double Q-learning. | Zongzhang Zhang, Zhiyuan Pan, Mykel J. Kochenderfer |
| 2016 | ICONIP | Deep Q-Learning with Prioritized Sampling. | Jianwei Zhai, Quan Liu, Zongzhang Zhang, Shan Zhong, Haijun Zhu, Peng Zhang, Cijia Sun |
| 2015 | ICTAI | Intelligent Model Learning Based on Variance for Bayesian Reinforcement Learning. | Shuhua You, Quan Liu, Zongzhang Zhang, Hui Wang, Xiaofang Zhang |
| 2015 | SoCS | PLEASE: Palm Leaf Search for POMDPs with Large Observation Spaces. | Zongzhang Zhang, David Hsu, Wee Sun Lee, Zhan Wei Lim, Aijun Bai |
| 2014 | ICML | Covering Number for Efficient Heuristic-based POMDP Planning. | Zongzhang Zhang, David Hsu, Wee Sun Lee |
| 2012 | AAAI | Covering Number as a Complexity Measure for POMDP Planning and Learning. | Zongzhang Zhang, Michael L. Littman, Xiaoping Chen |
| 2012 | UAI | FHHOP: A Factored Hybrid Heuristic Online Planning Algorithm for Large POMDPs. | Zongzhang Zhang, Xiaoping Chen |