| 2026 | ACL | Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts. | Jingting Zheng, Yuqi Ren, Linhao Yu, Yongqi Leng, Deyi Xiong |
| 2025 | ACL | Praetor: A Fine-Grained Generative LLM Evaluator with Instance-Level Customizable Evaluation Criteria. | Yongqi Leng, Renren Jin, Yue Chen, Zhuowen Han, Ling Shi, Jianxiang Peng, Lei Yang, Juesi Xiao, Deyi Xiong |
| 2025 | COLING | Towards Understanding Multi-Task Learning (Generalization) of LLMs via Detecting and Exploring Task-Specific Neurons. | Yongqi Leng, Deyi Xiong |
| 2025 | EMNLP | DecEx-RAG: Boosting Agentic Retrieval-Augmented Generation with Decision and Execution Optimization via Process Supervision. | Yongqi Leng, Yikun Lei, Xikai Liu, Meizhi Zhong, Bojian Xiong, Yurong Zhang, Yan Gao, Yi Wu, Yao Hu, Deyi Xiong |
| 2025 | EMNLP | Think-Search-Patch: A Retrieval-Augmented Reasoning Framework for Repository-Level Code Repair. | Bojian Xiong, Yikun Lei, Xikai Liu, Shaowei Zhang, Pengyun Zhu, Yan Liu, Yongqi Leng, Ling Shi, Meizhi Zhong, Yurong Zhang, Yan Gao, Yi Wu, Yao Hu, Deyi Xiong |
| 2025 | NAACL | Self-Pluralising Culture Alignment for Large Language Models. | Shaoyang Xu, Yongqi Leng, Linhao Yu, Deyi Xiong |
| 2024 | ACL | CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models. | Linhao Yu, Yongqi Leng, Yufei Huang, Shang Wu, Haixin Liu, Xinmeng Ji, Jiahui Zhao, Jinwang Song, Tingting Cui, Xiaoqing Cheng, Liutao Liutao, Deyi Xiong |
| 2024 | COLING | Can Large Language Models Learn Translation Robustness from Noisy-Source In-context Demonstrations? | Leiyu Pan, Yongqi Leng, Deyi Xiong |