| 2024 | IJCAI | Reinforcement Learning from Diverse Human Preferences. | Wanqi Xue, Bo An, Shuicheng Yan, Zhongwen Xu |
| 2023 | AAAI | Solving Large-Scale Pursuit-Evasion Games Using Pre-trained Strategies. | Shuxin Li, Xinrun Wang, Youzhi Zhang, Wanqi Xue, Jakub Cern, Bo An |
| 2023 | ICLR | ResAct: Reinforcing Long-term Engagement in Sequential Recommendation with Residual Actor. | Wanqi Xue, Qingpeng Cai, Ruohan Zhan, Dong Zheng, Peng Jiang, Kun Gai, Bo An |
| 2023 | KDD | Mastering Stock Markets with Efficient Mixture of Diversified Trading Experts. | Shuo Sun, Xinrun Wang, Wanqi Xue, Xiaoxuan Lou, Bo An |
| 2023 | KDD | PrefRec: Recommender Systems with Human Preferences for Reinforcing Long-term User Engagement. | Wanqi Xue, Qingpeng Cai, Zhenghai Xue, Shuo Sun, Shuchang Liu, Dong Zheng, Peng Jiang, Kun Gai, Bo An |
| 2023 | WWW | Two-Stage Constrained Actor-Critic for Short Video Recommendation. | Qingpeng Cai, Zhenghai Xue, Chi Zhang, Wanqi Xue, Shuchang Liu, Ruohan Zhan, Xueliang Wang, Tianyou Zuo, Wentao Xie, Dong Zheng, Peng Jiang, Kun Gai |
| 2022 | AAAI | NSGZero: Efficiently Learning Non-exploitable Policy in Large-Scale Network Security Games with Neural Monte Carlo Tree Search. | Wanqi Xue, Bo An, Chai Kiat Yeo |
| 2022 | CIKM | DeepScalper: A Risk-Aware Reinforcement Learning Framework to Capture Fleeting Intraday Trading Opportunities. | Shuo Sun, Wanqi Xue, Rundong Wang, Xu He, Junlei Zhu, Jian Li, Bo An |
| 2021 | IJCAI | CFR-MIX: Solving Imperfect Information Extensive-Form Games with Combinatorial Action Space. | Shuxin Li, Youzhi Zhang, Xinrun Wang, Wanqi Xue, Bo An |
| 2021 | IJCAI | Solving Large-Scale Extensive-Form Network Security Games via Neural Fictitious Self-Play. | Wanqi Xue, Youzhi Zhang, Shuxin Li, Xinrun Wang, Bo An, Chai Kiat Yeo |
| 2020 | AAAI | One-Shot Image Classification by Learning to Restore Prototypes. | Wanqi Xue, Wei Wang |