| 2026 | ACL | CodeContests-O: Powering LLMs via Feedback-Driven Iterative Test Case Generation. | Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Kangwen Zhao, Dongyun Xue, Mingxiao Feng, Wengang Zhou, Houqiang Li |
| 2026 | ACL | SGA-MCTS: Decoupling Planning from Execution via Training-Free Atomic Experience Retrieval. | Xin Xie, Dongyun Xue, Wuguannan Yao, Mingxiao Feng, Wengang Zhou, Xiang Qi, Houqiang Li, Peng Zhang |
| 2024 | AAAI | SUF: Stabilized Unconstrained Fine-Tuning for Offline-to-Online Reinforcement Learning. | Jiaheng Feng, Mingxiao Feng, Haolin Song, Wengang Zhou, Houqiang Li |
| 2024 | ICONIP | Temporal State Prediction and Sequence Recovery for Multi-agent Reinforcement Learning. | Yong Wang, Mingxiao Feng, Haolin Song, Wengang Zhou, Houqiang Li |
| 2023 | AAAI | H-TSP: Hierarchically Solving the Large-Scale Traveling Salesman Problem. | Xuanhao Pan, Yan Jin, Yuandong Ding, Mingxiao Feng, Li Zhao, Lei Song, Jiang Bian |
| 2023 | IJCAI | MA2CL: Masked Attentive Contrastive Learning for Multi-Agent Reinforcement Learning. | Haolin Song, Mingxiao Feng, Wengang Zhou, Houqiang Li |
| 2022 | KDD | Stabilizing Voltage in Power Distribution Networks via Multi-Agent Reinforcement Learning with Transformer. | Minrui Wang, Mingxiao Feng, Wengang Zhou, Houqiang Li |