| 2026 | ACL | CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation. | Sizhe Wang, Zhengren Wang, Dongsheng Ma, Yongan Yu, Rui Ling, Zhiyu Li, Feiyu Xiong, Wentao Zhang |
| 2026 | AIED | THiNK: Can Large Language Models Think-Aloud? | Yongan Yu, Mengqian Wu, Yiran Lin, Nikki G. Lobczowski |
| 2026 | CoNLL | Presupposition and Reasoning in Conditionals: A Theory-Based Study of Humans and LLMs. | Tara Azin, Yongan Yu, Raj Singh, Olessia Jouravlev |
| 2026 | SIGIR | WeatherArchive: A Benchmark for Retrieval-Augmented Reasoning over Historical Weather Archives. | Yongan Yu, Xianda Du, Qingchen Hu, Jiahao Liang, Jingwei Ni, Dan Qiang, Kaiyu Huang, Grant McKenzie, Rene Sieber, Fengran Mo |
| 2025 | ACL | WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models. | Yongan Yu, Qingchen Hu, Xianda Du, Jiayin Wang, Fengran Mo, Rene Sieber |
| 2025 | AIED | From Recall to Reasoning: Automated Question Generation for Deeper Math Learning Through Large Language Models. | Yongan Yu, Alexandre Krantz, Nikki G. Lobczowski |
| 2025 | UIST | MILO: An LLM Multi-Stage Conversational Agent for Fostering Teenagers' Mental Resilience. | Han Bao, Yongan Yu, Bohan Wang, Xiaowen Lu, Xin Tong |