| 2026 | AAAI | MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools. | Zikang Guo, Benfeng Xu, Chiwei Zhu, Wentao Hong, Xiaorui Wang, Zhendong Mao |
| 2026 | ACL | WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora. | Pengyu Wang, Benfeng Xu, Licheng Zhang, Shaohan Wang, Mingxuan Du, Chiwei Zhu, Zhendong Mao |
| 2026 | ACL | FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents. | Chiwei Zhu, Benfeng Xu, Mingxuan Du, Shaohan Wang, Xiaorui Wang, Zhendong Mao, Yongdong Zhang |
| 2026 | SIGIR | GraphSynthQA: Knowledge-Graph-Guided Query Synthesis and Step-Level Preference Optimization for Web Agents. | Chiwei Zhu, Mingxuan Du, Benfeng Xu, Shengzhuo Zhang, Xiaorui Wang, Zhendong Mao |
| 2025 | ACL | From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding. | Chiwei Zhu, Benfeng Xu, Xiaorui Wang, Zhendong Mao |
| 2025 | ACL | Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability. | Chiwei Zhu, Benfeng Xu, An Yang, Junyang Lin, Quan Wang, Chang Zhou, Zhendong Mao |
| 2025 | COLING | CMI-AIGCX at GenAI Detection Task 2: Leveraging Multilingual Proxy LLMs for Machine-Generated Text Detection in Academic Essays. | Kaijie Jiao, Xingyu Yao, Shixuan Ma, Sifan Fang, Zikang Guo, Benfeng Xu, Licheng Zhang, Quan Wang, Yongdong Zhang, Zhendong Mao |
| 2025 | EMNLP | Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach. | Ruizhe Li, Chiwei Zhu, Benfeng Xu, Xiaorui Wang, Zhendong Mao |
| 2025 | IJCAI | MIRROR: Multi-agent Intra- and Inter-Reflection for Optimized Reasoning in Tool Learning. | Zikang Guo, Benfeng Xu, Xiaorui Wang, Zhendong Mao |
| 2025 | IJCNN | PromptMetric: Prompt Recipe as an Automatic Metric for Evaluating Open-domain Question Answering Systems. | Pengzhe Wang, Xin Zeng, Chiwei Zhu, Benfeng Xu, Zhendong Mao, Yong-Dong Zhang |
| 2024 | AAAI | Benchmarking Large Language Models on Controllable Generation under Diversified Instructions. | Yihan Chen, Benfeng Xu, Quan Wang, Yi Liu, Zhendong Mao |
| 2024 | ACL | Disentangled Learning with Synthetic Parallel Data for Text Style Transfer. | Jingxuan Han, Quan Wang, Zikang Guo, Benfeng Xu, Licheng Zhang, Zhendong Mao |
| 2024 | EMNLP | KNN-Instruct: Automatic Instruction Construction with K Nearest Neighbor Deduction. | Jianshang Kou, Benfeng Xu, Chiwei Zhu, Zhendong Mao |
| 2023 | ACL | S2ynRE: Two-stage Self-training with Synthetic data for Low-resource Relation Extraction. | Benfeng Xu, Quan Wang, Yajuan Lyu, Dai Dai, Yongdong Zhang, Zhendong Mao |
| 2023 | EMNLP | On the Calibration of Large Language Models and Alignment. | Chiwei Zhu, Benfeng Xu, Quan Wang, Yongdong Zhang, Zhendong Mao |
| 2023 | ICASSP | Modaldrop: Modality-Aware Regularization for Temporal-Spectral Fusion in Human Activity Recognition. | Xin Zeng, Yiqiang Chen, Benfeng Xu, Tengxiang Zhang |
| 2023 | ICLR | $k$NN Prompting: Beyond-Context Learning with Calibration-Free Nearest Neighbor Inference. | Benfeng Xu, Quan Wang, Zhendong Mao, Yajuan Lyu, Qiaoqiao She, Yongdong Zhang |
| 2022 | EMNLP | UniRel: Unified Representation and Interaction for Joint Relational Triple Extraction. | Wei Tang, Benfeng Xu, Yuyue Zhao, Zhendong Mao, Yifeng Liu, Yong Liao, Haiyong Xie |
| 2022 | NAACL | EmRel: Joint Representation of Entities and Embedded Relations for Multi-triple Extraction. | Benfeng Xu, Quan Wang, Yajuan Lyu, Yabing Shi, Yong Zhu, Jie Gao, Zhendong Mao |
| 2021 | AAAI | Entity Structure Within and Throughout: Modeling Mention Dependencies for Document-Level Relation Extraction. | Benfeng Xu, Quan Wang, Yajuan Lyu, Yong Zhu, Zhendong Mao |
| 2020 | ACL | Curriculum Learning for Natural Language Understanding. | Benfeng Xu, Licheng Zhang, Zhendong Mao, Quan Wang, Hongtao Xie, Yongdong Zhang |