| 2026 | AAAI | Language Model Distillation: A Temporal Difference Imitation Learning Perspective. | Zishun Yu, Shangzhe Li, Xinhua Zhang |
| 2025 | AAAI | Towards Efficient Collaboration via Graph Modeling in Reinforcement Learning. | Wenzhe Fan, Zishun Yu, Chengdong Ma, Changye Li, Yaodong Yang, Xinhua Zhang |
| 2025 | ICML | Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization. | Zishun Yu, Tengyu Xu, Di Jin, Karthik Abinav Sankararaman, Yun He, Wenxuan Zhou, Zhouhao Zeng, Eryk Helenowski, Chen Zhu, Sinong Wang, Hao Ma, Han Fang |
| 2024 | ALT | Slowly Changing Adversarial Bandit Algorithms are Efficient for Discounted MDPs. | Ian A. Kash, Lev Reyzin, Zishun Yu |
| 2024 | ICLR | B-Coder: Value-Based Deep Reinforcement Learning for Program Synthesis. | Zishun Yu, Yunzhe Tao, Liyu Chen, Tao Sun, Hongxia Yang |
| 2024 | UAI | Offline Reward Perturbation Boosts Distributional Shift in Online RL. | Zishun Yu, Siteng Kang, Xinhua Zhang |
| 2023 | ICML | Actor-Critic Alignment for Offline-to-Online Reinforcement Learning. | Zishun Yu, Xinhua Zhang |
| 2022 | UAI | Orthogonal Gromov-Wasserstein discrepancy with efficient lower bound. | Hongwei Jin, Zishun Yu, Xinhua Zhang |