| 2026 | AAAI | Do Large Language Models Think like the Brain? Sentence-Level Evidences from Layer-Wise Embeddings and fMRI. | Yu Lei, Xingyang Ge, Yi Zhang, Yiming Yang, Bolei Ma |
| 2026 | ACL | FAITH: Factuality Alignment through Integrating Trustworthiness and Honestness. | Xiaoning Dong, Chengyan Wu, Yajie Wen, Yu Chen, Yun Xue, Zhang Jing, Wei Xu, Bolei Ma |
| 2026 | ACL | The Imperfective Paradox in Large Language Models. | Bolei Ma, Yusuke Miyao |
| 2026 | ACL | Capabilities and Evaluation Biases of Large Language Models in Classical Chinese Poetry Generation: A Case Study on Tang Poetry. | Bolei Ma, Yina Yao, Anna-Carolina Haensch |
| 2026 | ACL | MSMO-ABSA: Multi-Scale and Multi-Objective Optimization for Cross-Lingual Aspect-Based Sentiment Analysis. | Chengyan Wu, Bolei Ma, Ningyuan Deng, Yanqing He, Yun Xue, Xiaoyong Liu |
| 2026 | ACL | Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation. | Wei Zhou, Bolei Ma, Annemarie Friedrich, Mohsen Mesgar |
| 2026 | EACL | Too Open for Opinion? Embracing Open-Endedness in Large Language Models for Social Simulation. | Bolei Ma, Yong Cao, Indira Sen, Anna-Carolina Haensch, Frauke Kreuter, Barbara Plank, Daniel Hershcovich |
| 2025 | ACL | Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and Challenges. | Bolei Ma, Yuting Li, Wei Zhou, Ziwei Gong, Yang Janet Liu, Katja Jasinskaja, Annemarie Friedrich, Julia Hirschberg, Frauke Kreuter, Barbara Plank |
| 2025 | ACL | Algorithmic Fidelity of Large Language Models in Generating Synthetic German Public Opinions: A Case Study. | Bolei Ma, Berk Yoztyurk, Anna-Carolina Haensch, Xinpeng Wang, Markus Herklotz, Frauke Kreuter, Barbara Plank, Matthias Aenmacher |
| 2025 | EMNLP | Multimodal Emotion Recognition in Conversations: A Survey of Methods, Trends, Challenges and Prospects. | Chengyan Wu, Yiqiang Cai, Yang Liu, Pengxu Zhu, Yun Xue, Ziwei Gong, Julia Hirschberg, Bolei Ma |
| 2025 | EMNLP | M-ABSA: A Multilingual Dataset for Aspect-Based Sentiment Analysis. | ChengYan Wu, Bolei Ma, Yihong Liu, Zheyu Zhang, Ningyuan Deng, Yanshu Li, Baolan Chen, Yi Zhang, Yun Xue, Barbara Plank |
| 2025 | IJCNLP | Decomposed Prompting: Probing Multilingual Linguistic Structure Knowledge in Large Language Models. | Ercong Nie, Shuzhou Yuan, Bolei Ma, Helmut Schmid, Michael Frber, Frauke Kreuter, Hinrich Schtze |
| 2025 | IJCNN | Why Lift so Heavy? Slimming Large Language Models by Cutting Off the Layers. | Shuzhou Yuan, Ercong Nie, Bolei Ma, Michael Frber |
| 2025 | NAACL | Can Large Language Models Advance Crosswalks? The Case of Danish Occupation Codes. | Bolei Ma, Cynthia A. Huang, Anna-Carolina Haensch |
| 2024 | ACL | "My Answer is C": First-Token Probabilities Do Not Match Text Answers in Instruction-Tuned Language Models. | Xinpeng Wang, Bolei Ma, Chengzhi Hu, Leon Weber-Genzel, Paul Rttger, Frauke Kreuter, Dirk Hovy, Barbara Plank |
| 2024 | EACL | ToPro: Token-Level Prompt Decomposition for Cross-Lingual Sequence Labeling Tasks. | Bolei Ma, Ercong Nie, Shuzhou Yuan, Helmut Schmid, Michael Frber, Frauke Kreuter, Hinrich Schtze |
| 2024 | EMNLP | The Potential and Challenges of Evaluating Attitudes, Opinions, and Values in Large Language Models. | Bolei Ma, Xinpeng Wang, Tiancheng Hu, Anna-Carolina Haensch, Michael A. Hedderich, Barbara Plank, Frauke Kreuter |
| 2023 | EMNLP | Annotation Sensitivity: Training Data Collection Methods Affect Model Performance. | Christoph Kern, Stephanie Eckman, Jacob Beck, Rob Chew, Bolei Ma, Frauke Kreuter |