| 2026 | ACL | What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time. | Dong Yan, Jian Liang, Yanbo Wang, Shuo Lu, Ran He, Tieniu Tan |
| 2025 | AAAI | Sequential Preference Optimization: Multi-Dimensional Preference Alignment with Implicit Reward Modeling. | Xingzhou Lou, Junge Zhang, Jian Xie, Lifeng Liu, Dong Yan, Kaiqi Huang |
| 2025 | ACL | Reward Generalization in RLHF: A Topological Perspective. | Tianyi Alex Qiu, Fanzhi Zeng, Jiaming Ji, Dong Yan, Kaile Wang, Jiayi Zhou, Yang Han, Josef Dai, Xuehai Pan, Yaodong Yang |
| 2025 | ICLR | 3D-Properties: Identifying Challenges in DPO and Charting a Path Forward. | Yuzi Yan, Yibo Miao, Jialian Li, Yipin Zhang, Jian Xie, Zhijie Deng, Dong Yan |
| 2025 | ICLR | Learning LLM-as-a-Judge for Preference Alignment. | Ziyi Ye, Xiangsheng Li, Qiuchi Li, Qingyao Ai, Yujia Zhou, Wei Shen, Dong Yan, Yiqun Liu |
| 2025 | ICML | STAIR: Improving Safety Alignment with Introspective Reasoning. | Yichi Zhang, Siyuan Zhang, Yao Huang, Zeyu Xia, Zhengwei Fang, Xiao Yang, Ranjie Duan, Dong Yan, Yinpeng Dong, Jun Zhu |
| 2024 | EMNLP | Reward Modeling Requires Automatic Adjustment Based on Data Quality. | Binghai Wang, Rui Zheng, Lu Chen, Zhiheng Xi, Wei Shen, Yuhao Zhou, Dong Yan, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | ICML | Exploring the LLM Journey from Cognition to Expression with Linear Representations. | Yuzi Yan, Jialian Li, Yipin Zhang, Dong Yan |
| 2023 | IJCAI | On the Reuse Bias in Off-Policy Reinforcement Learning. | Chengyang Ying, Zhongkai Hao, Xinning Zhou, Hang Su, Dong Yan, Jun Zhu |
| 2022 | AAAI | Policy Learning for Robust Markov Decision Process with a Mismatched Generative Model. | Jialian Li, Tongzheng Ren, Dong Yan, Hang Su, Jun Zhu |
| 2022 | IJCAI | Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk. | Chengyang Ying, Xinning Zhou, Hang Su, Dong Yan, Ning Chen, Jun Zhu |
| 2021 | AAAI | Learning Task-Distribution Reward Shaping with Meta-Learning. | Haosheng Zou, Tongzheng Ren, Dong Yan, Hang Su, Jun Zhu |
| 2021 | IJCAI | Combining Tree Search and Action Prediction for State-of-the-Art Performance in DouDiZhu. | Yunsheng Zhang, Dong Yan, Bei Shi, Haobo Fu, Qiang Fu, Hang Su, Jun Zhu, Ning Chen |
| 2020 | ICLR | Lazy-CFR: fast and near-optimal regret minimization for extensive games with imperfect information. | Yichi Zhou, Tongzheng Ren, Jialian Li, Dong Yan, Jun Zhu |
| 2020 | WCNC | Characterization for High-Speed Railway Channel enabling Smart Rail Mobility at 22.6 GHz. | Lei Ma, Ke Guan, Dong Yan, Danping He, Bo Ai, Junhyeong Kim, Hee-Sang Chung |
| 2019 | IJCAI | Playing FPS Games With Environment-Aware Hierarchical Reinforcement Learning. | Shihong Song, Jiayi Weng, Hang Su, Dong Yan, Haosheng Zou, Jun Zhu |
| 2017 | COMPSAC | Comprehensive Static Analysis for Configurable Software via Combinatorial Instantiation. | Dong Yan, Linjie Pan, Rongjie Yan, Jun Yan, Jian Zhang |
| 2017 | ICSE | PSpec: a formal specification language for fine-grained control on distributed data analytics. | Chen Luo, Fei He, Dong Yan, Dan Zhang, Xin Zhou, Bow-Yaw Wang |
| 2016 | APSEC | The Floating-Point Extension of Symbolic Execution Engine for Bug Detection. | Xingming Wu, Zhenbo Xu, Dong Yan, Tianyong Wu, Jun Yan, Jian Zhang |
| 2011 | TrustCom | The Role of Trust in Social Life. | Dong Yan, Wang Qi |
| 2007 | Networking | Throughput Analysis Considering Capture Effect in IEEE 802.11 Networks. | Xiaohu Ge, Dong Yan, Yaoting Zhu |