| 2026 | AAAI | MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools. | Zikang Guo, Benfeng Xu, Chiwei Zhu, Wentao Hong, Xiaorui Wang, Zhendong Mao |
| 2026 | ACL | WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora. | Pengyu Wang, Benfeng Xu, Licheng Zhang, Shaohan Wang, Mingxuan Du, Chiwei Zhu, Zhendong Mao |
| 2026 | ACL | FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents. | Chiwei Zhu, Benfeng Xu, Mingxuan Du, Shaohan Wang, Xiaorui Wang, Zhendong Mao, Yongdong Zhang |
| 2026 | SIGIR | GraphSynthQA: Knowledge-Graph-Guided Query Synthesis and Step-Level Preference Optimization for Web Agents. | Chiwei Zhu, Mingxuan Du, Benfeng Xu, Shengzhuo Zhang, Xiaorui Wang, Zhendong Mao |
| 2025 | ACL | From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding. | Chiwei Zhu, Benfeng Xu, Xiaorui Wang, Zhendong Mao |
| 2025 | ACL | Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability. | Chiwei Zhu, Benfeng Xu, An Yang, Junyang Lin, Quan Wang, Chang Zhou, Zhendong Mao |
| 2025 | EMNLP | Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach. | Ruizhe Li, Chiwei Zhu, Benfeng Xu, Xiaorui Wang, Zhendong Mao |
| 2025 | IJCNN | PromptMetric: Prompt Recipe as an Automatic Metric for Evaluating Open-domain Question Answering Systems. | Pengzhe Wang, Xin Zeng, Chiwei Zhu, Benfeng Xu, Zhendong Mao, Yong-Dong Zhang |
| 2024 | EMNLP | KNN-Instruct: Automatic Instruction Construction with K Nearest Neighbor Deduction. | Jianshang Kou, Benfeng Xu, Chiwei Zhu, Zhendong Mao |
| 2023 | EMNLP | Grammatical Error Correction via Mixed-Grained Weighted Training. | Jiahao Li, Quan Wang, Chiwei Zhu, Zhendong Mao, Yongdong Zhang |
| 2023 | EMNLP | On the Calibration of Large Language Models and Alignment. | Chiwei Zhu, Benfeng Xu, Quan Wang, Yongdong Zhang, Zhendong Mao |