Zhiheng Xi
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
50
Venues
8
Active years
2022–2026
Best venue rank
A*
Where they publish
Papers
50 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study. | Xiaoran Fan, Zhichao Sun, Yangfan Gao, Jingfei Xiong, Hang Yan, Yifei Cao, Jiajun Sun, Shuo Li, Zhihao Zhang, Zhiheng Xi, Yuhao Zhou, Senjie Jin, Changhao Jiang, Junjie Ye, Ming Zhang, Rui Zheng, Zhenhua Han, Yunke Zhang, Demei Yan, Shaokang Dong, Tao Ji, Tao Gui |
| 2026 | AAAI | Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination. | Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang |
| 2026 | AAAI | MetaAct-RL: Training Language Models for Reasoning Through Meta-Action-Based Reinforcement Learning. | Zhiheng Xi, Yuhui Wang, Yiwen Ding, Guanyu Li, Senjie Jin, Shichun Liu, Jixuan Huang, Dingwen Yang, Jiafu Tang, Boyang Hong, Junjie Ye, Shihan Dou, Ming Zhang, Jian Guan, Wei Wu, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | From Scores to Preferences: Redefining Evaluation Paradigm for Speech Quality Reward Modeling. | Yifei Cao, Changhao Jiang, Jiabao Zhuang, Jiajun Sun, Ming Zhang, Zhiheng Xi, Hui Li, Shihan Dou, Yuran Wang, Yunke Zhang, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | Counteracting the Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing. | Xin Guo, Zhiheng Xi, Yiwen Ding, Yitao Zhai, Xiaowei Shi, Xunliang Cai, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training. | Changhao Jiang, Ming Zhang, Yifei Cao, Junjie Ye, Xiaoran Fan, Shihan Dou, Zhiheng Xi, Jiajun Sun, Yi Dong, Yujiong Shen, Jingqi Tong, Baoyu Fan, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning. | Jiahang Lin, Kai Hu, Binghai Wang, Yuhao Zhou, Zhiheng Xi, Honglin Guo, Shichun Liu, Junzhe Wang, Shihan Dou, Enyu Zhou, Hang Yan, Zhenhua Han, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization. | Junzhe Wang, Zhiheng Xi, Yajie Yang, Hao Luo, Shihan Dou, Tao Gui, Qi Zhang |
| 2026 | ACL | AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments. | Zhiheng Xi, Dingwen Yang, Jiaqi Liu, Jixuan Huang, Honglin Guo, Baodai Huang, Tinggang Chen, Qi Zhang, Zhonghang Lu, Chenyu Liu, Jiajun Sun, Jiazheng Zhang, Dingwei Zhu, Xin Guo, Junzhe Wang, Zhihao Zhang, Yuming Yang, Junjie Ye, Minghe Gao, Dongrui Liu, Jiaming Ji, Guohao Li, Tao Gui, Xuanjing Huang |
| 2026 | ACL | ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development. | Jie Yang, Honglin Guo, Li Ji, Jiazheng Zhou, Rui Zheng, Zhikai Lei, Shuo Zhang, Zhiheng Xi, Shichun Liu, Yuxin Wang, Bo Wang, Yining Zheng, Tao Gui, Xipeng Qiu |
| 2026 | ACL | Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment. | Yuming Yang, Mingyoung Lai, Wanxu Zhao, Xiaoran Fan, Zhiheng Xi, Mingqi Wu, Chiyue Huang, Jun Zhao, Haijun Lv, Jian Tong, Yunhua Zhou, Yicheng Zou, Qipeng Guo, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments. | Junjie Ye, Changhao Jiang, Zhengyin Du, Yufei Xu, Xuesong Yao, Zhiheng Xi, Xiaoran Fan, Qi Zhang, Tao Gui, Xuanjing Huang, Jiecao Chen |
| 2026 | ACL | AgentV-RL: Scaling Reward Modeling with Agentic Verifier. | Jiazheng Zhang, Ziche Fu, Zhiheng Xi, Wenqing Jing, Mingxu Chai, Wei He, Guoqiang Zhang, Chenghao Fan, Chenxin An, Wenxiang Chen, Zhicheng Liu, Haojie Pan, Dingwei Zhu, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models. | Ming Zhang, Yujiong Shen, Jingyi Deng, Yuhui Wang, Huayu Sha, Kexin Tan, Qiyuan Peng, Yue Zhang, Junzhe Wang, Shichun Liu, Yueyuan Huang, Jingqi Tong, Changhao Jiang, Yilong Wu, Zhihao Zhang, Mingqi Wu, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models. | Hengyuan Zhang, Zhihao Zhang, Ercong Nie, Mingyang Wang, Zunhai Su, Yiwei Wang, Qianli Wang, Shuzhou Yuan, Xufeng Duan, Qibo Xue, Zeping Yu, Chenming Shang, Xiao Liang, Jing Xiong, Hui Shen, Chaofan Tao, Zhengwu Liu, Senjie Jin, Zhiheng Xi, Dongdong Zhang, Sophia Ananiadou, Tao Gui, Ruobing Xie, Hayden Kwok-Hay So, Hinrich Schtze, Xuanjing Huang, Qi Zhang, Ngai Wong |
| 2026 | ACL | VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training. | Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang |
| 2026 | WWW | AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress. | Zhiheng Xi, Chenyang Liao, Guanyu Li, Zhihao Zhang, Wenxiang Chen, Binghai Wang, Senjie Jin, Yuhao Zhou, Jian Guan, Wei Wu, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | ACL | Better Process Supervision with Bi-directional Rewarding Signals. | Wenxiang Chen, Wei He, Zhiheng Xi, Honglin Guo, Boyang Hong, Jiazheng Zhang, Nijun Li, Tao Gui, Yun Li, Qi Zhang, Xuanjing Huang |
| 2025 | ACL | Multi-Programming Language Sandbox for LLMs. | Shihan Dou, Jiazheng Zhang, Jianxiang Zang, Yunbo Tao, Weikang Zhou, Haoxiang Jia, Shichun Liu, Yuming Yang, Shenxi Wu, Zhiheng Xi, Muling Wu, Rui Zheng, Changze Lv, Limao Xiong, Shaoqing Zhang, Lin Zhang, Wenyu Zhan, Rongxiang Weng, Jingang Wang, Xunliang Cai, Yueming Wu, Ming Wen, Yixin Cao, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang |
| 2025 | ACL | CritiQ: Mining Data Quality Criteria from Human Preferences. | Honglin Guo, Kai Lv, Qipeng Guo, Tianyi Liang, Zhiheng Xi, Demin Song, Qiuyinzhe Zhang, Yu Sun, Kai Chen, Xipeng Qiu, Tao Gui |
| 2025 | ACL | AgentGym: Evaluating and Training Large Language Model-based Agents across Diverse Environments. | Zhiheng Xi, Yiwen Ding, Wenxiang Chen, Boyang Hong, Honglin Guo, Junzhe Wang, Xin Guo, Dingwen Yang, Chenyang Liao, Wei He, Songyang Gao, Lu Chen, Rui Zheng, Yicheng Zou, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang, Zuxuan Wu, Yu-Gang Jiang |
| 2025 | ACL | ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use. | Junjie Ye, Zhengyin Du, Xuesong Yao, Weijian Lin, Yufei Xu, Zehui Chen, Zaiyuan Wang, Sining Zhu, Zhiheng Xi, Siyu Yuan, Tao Gui, Qi Zhang, Xuanjing Huang, Jiecao Chen |
| 2025 | ACL | PFDial: A Structured Dialogue Instruction Fine-tuning Method Based on UML Flowcharts. | Ming Zhang, Yuhui Wang, Yujiong Shen, Tingyi Yang, Changhao Jiang, Yilong Wu, Shihan Dou, Qinhao Chen, Zhiheng Xi, Zhihao Zhang, Yi Dong, Zhen Wang, Zhihui Fei, Mingyang Wan, Tao Liang, Guojun Ma, Qi Zhang, Tao Gui, Xuanjing Huang |
| 2025 | ACL | Are LLMs Rational Investors? A Study on the Financial Bias in LLMs. | Yuhang Zhou, Yuchen Ni, Zhiheng Xi, Zhangyue Yin, Yu He, Gan Yunhui, Xiang Liu, Zhang Jian, Sen Liu, Xipeng Qiu, Yixin Cao, Guangnan Ye, Hongfeng Chai |
| 2025 | EMNLP | Distill Visual Chart Reasoning Ability from LLMs to MLLMs. | Wei He, Zhiheng Xi, Wanxu Zhao, Xiaoran Fan, Yiwen Ding, Zifei Shan, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | EMNLP | Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning. | Senjie Jin, Lu Chen, Zhiheng Xi, Yuhui Wang, Sirui Song, Yuhao Zhou, Xinbo Zhang, Peng Sun, Hong Lu, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | EMNLP | Mitigating Object Hallucinations in MLLMs via Multi-Frequency Perturbations. | Shuo Li, Jiajun Sun, Guodong Zheng, Xiaoran Fan, Yujiong Shen, Yi Lu, Zhiheng Xi, Yuming Yang, Wenming Tan, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | EMNLP | LoRACoE: Improving Large Language Model via Composition-based LoRA Expert. | Guanyu Li, Zhiheng Xi, Zhihao Zhang, Boyang Hong, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | EMNLP | TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use. | Junjie Ye, Yilong Wu, Sixian Li, Yuming Yang, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang, Peng Wang, Zhongchao Shi, Jianping Fan, Zhengyin Du |
| 2025 | EMNLP | LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation. | Ming Zhang, Yujiong Shen, Zelin Li, Huayu Sha, Binze Hu, Yuhui Wang, Chenhao Huang, Shichun Liu, Jingqi Tong, Changhao Jiang, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | EMNLP | Toward Optimal LLM Alignments Using Two-Player Games. | Rui Zheng, Hongyi Guo, Zhihan Liu, Xiaoying Zhang, Yuanshun Yao, Xiaojun Xu, Zhaoran Wang, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang, Yang Liu, Hang Li |
| 2025 | ICLR | Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs. | Shuo Li, Tao Ji, Xiaoran Fan, Linsheng Lu, Leyi Yang, Yuming Yang, Zhiheng Xi, Rui Zheng, Yuran Wang, Xiaohui Zhao, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | ICLR | RMB: Comprehensively benchmarking reward models in LLM alignment. | Enyu Zhou, Guodong Zheng, Binghai Wang, Zhiheng Xi, Shihan Dou, Rong Bao, Wei Shen, Limao Xiong, Jessica Fan, Yurong Mou, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | NAACL | Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling. | Yiwen Ding, Zhiheng Xi, Wei He, Lizhuoyuan Lizhuoyuan, Yitao Zhai, Shi Xiaowei, Xunliang Cai, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | ACL | StepCoder: Improving Code Generation with Reinforcement Learning from Compiler Feedback. | Shihan Dou, Yan Liu, Haoxiang Jia, Enyu Zhou, Limao Xiong, Junjie Shan, Caishuang Huang, Xiao Wang, Xiaoran Fan, Zhiheng Xi, Yuhao Zhou, Tao Ji, Rui Zheng, Qi Zhang, Tao Gui, Xuanjing Huang |
| 2024 | ACL | LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style Plugin. | Shihan Dou, Enyu Zhou, Yan Liu, Songyang Gao, Wei Shen, Limao Xiong, Yuhao Zhou, Xiao Wang, Zhiheng Xi, Xiaoran Fan, Shiliang Pu, Jiang Zhu, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | COLING | RoCoIns: Enhancing Robustness of Large Language Models through Code-Style Instructions. | Yuansen Zhang, Xiao Wang, Zhiheng Xi, Han Xia, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | COLING | Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals. | Rui Zheng, Yuhao Zhou, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | COLING | ORTicket: Let One Robust BERT Ticket Transfer across Different Tasks. | Yuhao Zhou, Wenxiang Chen, Rui Zheng, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | EMNLP | Improving Discriminative Capability of Reward Models in RLHF Using Contrastive Learning. | Lu Chen, Rui Zheng, Binghai Wang, Senjie Jin, Caishuang Huang, Junjie Ye, Zhihao Zhang, Yuhao Zhou, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | EMNLP | Reward Modeling Requires Automatic Adjustment Based on Data Quality. | Binghai Wang, Rui Zheng, Lu Chen, Zhiheng Xi, Wei Shen, Yuhao Zhou, Dong Yan, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | EMNLP | Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data. | Han Xia, Songyang Gao, Qiming Ge, Zhiheng Xi, Qi Zhang, Xuanjing Huang |
| 2024 | ICLR | Improving Generalization of Alignment with Human Preferences through Group Invariant Learning. | Rui Zheng, Wei Shen, Yuan Hua, Wenbin Lai, Shihan Dou, Yuhao Zhou, Zhiheng Xi, Xiao Wang, Haoran Huang, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | ICML | Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning. | Zhiheng Xi, Wenxiang Chen, Boyang Hong, Senjie Jin, Rui Zheng, Wei He, Yiwen Ding, Shichun Liu, Xin Guo, Junzhe Wang, Honglin Guo, Wei Shen, Xiaoran Fan, Yuhao Zhou, Shihan Dou, Xiao Wang, Xinbo Zhang, Peng Sun, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | NAACL | Self-Demos: Eliciting Out-of-Demonstration Generalizability in Large Language Models. | Wei He, Shichun Liu, Jun Zhao, Yiwen Ding, Yi Lu, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2023 | ACL | Connectivity Patterns are Task Embeddings. | Zhiheng Xi, Rui Zheng, Yuansen Zhang, Xuanjing Huang, Zhongyu Wei, Minlong Peng, Mingming Sun, Qi Zhang, Tao Gui |
| 2023 | ACL | Characterizing the Impacts of Instances on Robustness. | Rui Zheng, Zhiheng Xi, Qin Liu, Wenbin Lai, Tao Gui, Qi Zhang, Xuanjing Huang, Jin Ma, Ying Shan, Weifeng Ge |
| 2023 | EMNLP | Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement. | Zhiheng Xi, Senjie Jin, Yuhao Zhou, Rui Zheng, Songyang Gao, Jia Liu, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2023 | EMNLP | RealBehavior: A Framework for Faithfully Characterizing Foundation Models' Human-like Behavior Mechanisms. | Enyu Zhou, Rui Zheng, Zhiheng Xi, Songyang Gao, Xiaoran Fan, Zichu Fei, Jingting Ye, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2022 | EMNLP | Efficient Adversarial Training with Robust Early-Bird Tickets. | Zhiheng Xi, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang |