Qi Yi
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
13
Venues
5
Active years
2021–2026
Best venue rank
A*
Where they publish
Papers
13 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward. | Guanhua Huang, Tingqiang Xu, Mingze Wang, Qi Yi, Xue Gong, Siheng Li, Ruibin Xiong, Kejiao Li, Yuhao Jiang, Bo Zhou |
| 2026 | ACL | Reinforcement Learning on Pre-Training Data. | Siheng Li, Kejiao Li, Zenan Xu, Guanhua Huang, Kun Li, Haoyuan Wu, Jiajia Wu, Zihao Zheng, Chenchen Zhang, Kun Shi, Xue Gong, Qi Yi, Ruibin Xiong, Tingqiang Xu, Yuhao Jiang, Jianfeng Yan, Yuyuan Zeng, Guanghui Xu, Jinbao Xue, Zhijiang Xu, Zheng Fang, Shuai Li, Qibin Liu, Xiaoxue Li, Zhuoyu Li, Yangyu Tao, Fei Gao, Cheng Jiang, Bochao Wang, Kai Liu, Jianchen Zhu, Wai Lam, Bo Zhou, Di Wang |
| 2026 | ACL | Rhombus: Incentivizing Coordination in Parallel Thinking through Reinforcement Learning. | Ziyuan Nan, Qi Yi, Di Huang, Yutong Wu, Guanhua Huang, Xue Gong, Kejiao Li, Yuhao Jiang, Chenchen Zhang, Zenan Xu, Xing Hu, Bo Zhou |
| 2026 | ACL | AT²PO: Agentic Turn-based Policy Optimization via Tree Search. | Zefang Zong, Dingwei Chen, Yang Li, Qi Yi, Bo Zhou, Chengming Li, B. O. Qian, Peng Chen, Jie Jiang |
| 2024 | AAAI | Hypothesis, Verification, and Induction: Grounding Large Language Models with Self-Driven Skill Learning. | Shaohui Peng, Xing Hu, Qi Yi, Rui Zhang, Jiaming Guo, Di Huang, Zikang Tian, Ruizhi Chen, Zidong Du, Qi Guo, Yunji Chen, Ling Li |
| 2024 | AAAI | OCEAN-MBRL: Offline Conservative Exploration for Model-Based Offline Reinforcement Learning. | Fan Wu, Rui Zhang, Qi Yi, Yunkai Gao, Jiaming Guo, Shaohui Peng, Siming Lan, Husheng Han, Yansong Pan, Kaizhao Yuan, Pengwei Jin, Ruizhi Chen, Yunji Chen, Ling Li |
| 2024 | AAAI | Emergent Communication for Numerical Concepts Generalization. | Enshuai Zhou, Yifan Hao, Rui Zhang, Yuxuan Guo, Zidong Du, Xishan Zhang, Xinkai Song, Chao Wang, Xuehai Zhou, Jiaming Guo, Qi Yi, Shaohui Peng, Di Huang, Ruizhi Chen, Qi Guo, Yunji Chen |
| 2024 | ICML | Prompt-based Visual Alignment for Zero-shot Policy Transfer. | Haihan Gao, Rui Zhang, Qi Yi, Hantao Yao, Haochen Li, Jiaming Guo, Shaohui Peng, Yunkai Gao, QiCheng Wang, Xing Hu, Yuanbo Wen, Zihao Zhang, Zidong Du, Ling Li, Qi Guo, Yunji Chen |
| 2023 | AAAI | ImageNet Pre-training Also Transfers Non-robustness. | Jiaming Zhang, Jitao Sang, Qi Yi, Yunfan Yang, Huiwen Dong, Jian Yu |
| 2023 | AAAI | Conceptual Reinforcement Learning for Language-Conditioned Tasks. | Shaohui Peng, Xing Hu, Rui Zhang, Jiaming Guo, Qi Yi, Ruizhi Chen, Zidong Du, Ling Li, Qi Guo, Yunji Chen |
| 2023 | CVPR | Unlearnable Clusters: Towards Label-Agnostic Unlearnable Examples. | Jiaming Zhang, Xingjun Ma, Qi Yi, Jitao Sang, Yu-Gang Jiang, Yaowei Wang, Changsheng Xu |
| 2023 | ICML | Online Prototype Alignment for Few-shot Policy Transfer. | Qi Yi, Rui Zhang, Shaohui Peng, Jiaming Guo, Yunkai Gao, Kaizhao Yuan, Ruizhi Chen, Siming Lan, Xing Hu, Zidong Du, Xishan Zhang, Qi Guo, Yunji Chen |
| 2021 | IJCAI | Hindsight Value Function for Variance Reduction in Stochastic Dynamic Environment. | Jiaming Guo, Rui Zhang, Xishan Zhang, Shaohui Peng, Qi Yi, Zidong Du, Xing Hu, Qi Guo, Yunji Chen |