| 2025 | ICLR | Entropy-based Activation Function Optimization: A Method on Searching Better Activation Functions. | Haoyuan Sun, Zihao Wu, Bo Xia, Pu Chang, Zibin Dong, Yifu Yuan, Yongzhe Chang, Xueqian Wang |
| 2025 | ICML | R*: Efficient Reward Design via Reward Structure Evolution and Parameter Alignment Optimization with Large Language Models. | Pengyi Li, Jianye Hao, Hongyao Tang, Yifu Yuan, Jinbin Qiao, Zibin Dong, Yan Zheng |
| 2025 | ICML | MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning. | Yifu Yuan, Zhenrui Zheng, Zibin Dong, Jianye Hao |
| 2024 | ICLR | AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model. | Zibin Dong, Yifu Yuan, Jianye Hao, Fei Ni, Yao Mu, Yan Zheng, Yujing Hu, Tangjie Lv, Changjie Fan, Zhipeng Hu |
| 2024 | ICLR | Uni-RLHF: Universal Platform and Benchmark Suite for Reinforcement Learning with Diverse Human Feedback. | Yifu Yuan, Jianye Hao, Yi Ma, Zibin Dong, Hebin Liang, Jinyi Liu, Zhixin Feng, Kai Zhao, Yan Zheng |
| 2024 | ICML | KISA: A Unified Keyframe Identifier and Skill Annotator for Long-Horizon Robotics Demonstrations. | Longxin Kou, Fei Ni, Yan Zheng, Jinyi Liu, Yifu Yuan, Zibin Dong, Jianye Hao |
| 2023 | CIKM | A Hierarchical Imitation Learning-based Decision Framework for Autonomous Driving. | Hebin Liang, Zibin Dong, Yi Ma, Xiaotian Hao, Yan Zheng, Jianye Hao |