| 2026 | AAAI | Multi-granularity Intent Modeling with Adversarial Robustness for Sequential Recommendation. | Yangyi Fang, Haolin Shi |
| 2026 | ACL | How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization. | Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai |
| 2026 | ACL | Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training. | Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chang Liu |
| 2026 | ACL | Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning. | Yangyi Fang, Haolin Shi |
| 2026 | ACL | From łog π to π: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight. | Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng |
| 2026 | ACL | MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning. | Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai |
| 2026 | SIGIR | Gesture Clustering for Real-Time User Disentanglement in Shared-Account Recommendation. | Huiying Hu, Xinlang Yue, Kexin Yi, Lingzhen Xu, Yangyi Fang, Muyang Li, Yongqi Liu, Kaiqiao Zhan |