| 2026 | ACL | Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems. | Mengzhuo Chen, Junjie Wang, Fangwen Mu, Yawen Wang, Zhe Liu, Huanxiang Feng, Qing Wang |
| 2026 | ACL | Scaling is Not All You Need: Clinical-Oriented Reinforcement Learning Makes Parameter-Efficient Clinical Reasoning. | Chi Liu, Yan Shu, Mengzhuo Chen, Hongming Piao, Zhijian Duan, Derek Li, Bryan Dai |
| 2024 | CHI | Unblind Text Inputs: Predicting Hint-text of Text Input in Mobile Apps via LLM. | Zhe Liu, Chunyang Chen, Junjie Wang, Mengzhuo Chen, Boyu Wu, Yuekai Huang, Jun Hu, Qing Wang |
| 2024 | ICSE | Make LLM a Testing Expert: Bringing Human-like Interaction to Mobile GUI Testing via Functionality-aware Decisions. | Zhe Liu, Chunyang Chen, Junjie Wang, Mengzhuo Chen, Boyu Wu, Xing Che, Dandan Wang, Qing Wang |
| 2024 | ICSE | Testing the Limits: Unusual Text Inputs Generation for Mobile App Crash Detection with Large Language Model. | Zhe Liu, Chunyang Chen, Junjie Wang, Mengzhuo Chen, Boyu Wu, Zhilin Tian, Yuekai Huang, Jun Hu, Qing Wang |