| 2026 | KDD | Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models? | Yun Qu, Qi Wang, Yixiu Mao, Vincent Tao Hu, Bjrn Ommer, Xiangyang Ji |
| 2025 | AAAI | Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning. | Yun Qu, Yuhang Jiang, Boyuan Wang, Yixiu Mao, Cheems Wang, Chang Liu, Xiangyang Ji |
| 2025 | ICCV | Lessons and Winning Solutions in Industrial Object Detection and Pose Estimation from the 2025 Bin-Picking Perception Challenge. | Ziqin Huang, Chengxi Li, Yingyue Li, Xingyu Liu, Chenyangguang Zhang, Ruida Zhang, Bowen Fu, Xinggang Hu, Yun Qu, Mengge Liu, Yixiu Mao, Wendong Huang, Gu Wang, Xiangyang Ji |
| 2025 | ICML | Fast and Robust: Task Sampling with Posterior and Diversity Synergies for Adaptive Decision-Makers in Randomized Environments. | Yun Qu, Cheems Wang, Yixiu Mao, Yiqin Lv, Xiangyang Ji |
| 2025 | KDD | Robust Fast Adaptation from Adversarially Explicit Task Distribution Generation. | Qi (Cheems) Wang, Yiqin Lv, Yixiu Mao, Yun Qu, Yi Xu, Xiangyang Ji |
| 2023 | ICLR | In-sample Actor Critic for Offline Reinforcement Learning. | Hongchang Zhang, Yixiu Mao, Boyuan Wang, Shuncheng He, Yi Xu, Xiangyang Ji |
| 2023 | ICML | Supported Trust Region Optimization for Offline Reinforcement Learning. | Yixiu Mao, Hongchang Zhang, Chen Chen, Yi Xu, Xiangyang Ji |
| 2021 | ICLR | A Hypergradient Approach to Robust Regression without Correspondence. | Yujia Xie, Yixiu Mao, Simiao Zuo, Hongteng Xu, Xiaojing Ye, Tuo Zhao, Hongyuan Zha |