| 2025 | ACL | MEDEC: A Benchmark for Medical Error Detection and Correction in Clinical Notes. | Asma Ben Abacha, Wen-Wai Yim, Yujuan Fu, Zhaoyi Sun, Meliha Yetisgen, Fei Xia, Thomas Lin |
| 2025 | NAACL | Does Data Contamination Detection Work (Well) for LLMs? A Survey and Evaluation on Detection Assumptions. | Yujuan Fu, zlem Uzuner, Meliha Yetisgen, Fei Xia |
| 2024 | COLING | Extracting Social Determinants of Health from Pediatric Patient Notes Using Large Language Models: Novel Corpus and Methods. | Yujuan Fu, Giridhar Kaushik Ramachandran, Nicholas J. Dobbins, Namu Park, Michael Leu, Abby R. Rosenberg, Kevin Lybarger, Fei Xia, zlem Uzuner, Meliha Yetisgen |
| 2024 | COLING | To Err Is Human, How about Medical Large Language Models? Comparing Pre-trained Language Models for Medical Assessment Errors and Reliability. | Wen-Wai Yim, Yujuan Fu, Asma Ben Abacha, Meliha Yetisgen |
| 2024 | MICCAI | DermaVQA: A Multilingual Visual Question Answering Dataset for Dermatology. | Wen-Wai Yim, Yujuan Fu, Zhaoyi Sun, Asma Ben Abacha, Meliha Yetisgen, Fei Xia |