| 2026 | ACL | Large Reasoning Models Are (Not Yet) Multilingual Latent Reasoners. | Yihong Liu, Raoyuan Zhao, Hinrich Schtze, Michael A. Hedderich |
| 2026 | ACL | Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors. | Raoyuan Zhao, Yihong Liu, Lena Altinger, Hinrich Schtze, Michael A. Hedderich |
| 2026 | EACL | A Comprehensive Evaluation of Multilingual Chain-of-Thought Reasoning: Performance, Consistency, and Faithfulness Across Languages. | Raoyuan Zhao, Yihong Liu, Hinrich Schtze, Michael A. Hedderich |
| 2025 | ACL | What's the Difference? Supporting Users in Identifying the Effects of Prompt and Model Changes Through Token Patterns. | Michael A. Hedderich, Anyi Wang, Raoyuan Zhao, Florian Eichin, Jonas Fischer, Barbara Plank |
| 2025 | EMNLP | MAKIEval: A Multilingual Automatic WiKidata-based Framework for Cultural Awareness Evaluation for LLMs. | Raoyuan Zhao, Beiduo Chen, Barbara Plank, Michael A. Hedderich |
| 2025 | EMNLP | Do We Know What LLMs Don't Know? A Study of Consistency in Knowledge Probing. | Raoyuan Zhao, Abdullatif Kksal, Ali Modarressi, Michael A. Hedderich, Hinrich Schtze |
| 2024 | EMNLP | SynthEval: Hybrid Behavioral Testing of NLP Models with Synthetic Evaluation. | Raoyuan Zhao, Abdullatif Kksal, Yihong Liu, Leonie Weissweiler, Anna Korhonen, Hinrich Schtze |