| 2026 | ACL | Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles. | Fatima Jahara, Mark Dredze, Sharon Levy |
| 2026 | ACL | Characterizing Selective Refusal Bias in Large Language Models. | Adel Khorramrouz, Sharon Levy |
| 2025 | ACL | Making FETCH! Happen: Finding Emergent Dog Whistles Through Common Habitats. | Kuleen Sasse, Carlos Alejandro Aguirre, Isabel Cachola, Sharon Levy, Mark Dredze |
| 2025 | NAACL | LLMs are Biased Teachers: Evaluating LLM Bias in Personalized Education. | Iain Weissburg, Sathvika Anand, Sharon Levy, Haewon Jeong |
| 2024 | EMNLP | Gender Bias in Decision-Making with Large Language Models: A Study of Relationship Conflicts. | Sharon Levy, William D. Adler, Tahilin Sanchez Karver, Mark Dredze, Michelle R. Kaufman |
| 2024 | EMNLP | Evaluating Biases in Context-Dependent Sexual and Reproductive Health Questions. | Sharon Levy, Tahilin Sanchez Karver, William D. Adler, Michelle R. Kaufman, Mark Dredze |
| 2024 | NAACL | Lost in Translation? Translation Errors and Challenges for Fair Assessment of Text-to-Image Models on Multilingual Concepts. | Michael Saxon, Yiran Luo, Sharon Levy, Chitta Baral, Yezhou Yang, William Yang Wang |
| 2023 | ACL | Foveate, Attribute, and Rationalize: Towards Physically Safe and Trustworthy AI. | Alex Mei, Sharon Levy, William Yang Wang |
| 2023 | EACL | Addressing Issues of Cross-Linguality in Open-Retrieval Question Answering Systems For Emergent Domains. | Alon Albalak, Sharon Levy, William Yang Wang |
| 2023 | EMNLP | Comparing Biases and the Impact of Multilingual Training across Multiple Languages. | Sharon Levy, Neha Anna John, Ling Liu, Yogarshi Vyas, Jie Ma, Yoshinari Fujinuma, Miguel Ballesteros, Vittorio Castelli, Dan Roth |
| 2023 | EMNLP | ASSERT: Automated Safety Scenario Red Teaming for Evaluating the Robustness of Large Language Models. | Alex Mei, Sharon Levy, William Yang Wang |
| 2023 | ICLR | WikiWhy: Answering and Explaining Cause-and-Effect Questions. | Matthew Ho, Aditya Sharma, Justin Chang, Michael Saxon, Sharon Levy, Yujie Lu, William Yang Wang |
| 2022 | ACL | HybriDialogue: An Information-Seeking Dialogue Dataset Grounded on Tabular and Textual Data. | Kai Nakamura, Sharon Levy, Yi-Lin Tuan, Wenhu Chen, William Yang Wang |
| 2022 | EMNLP | SafeText: A Benchmark for Exploring Physical Safety in Language Models. | Sharon Levy, Emily Allaway, Melanie Subbiah, Lydia B. Chilton, Desmond Patton, Kathleen R. McKeown, William Yang Wang |
| 2022 | EMNLP | Mitigating Covertly Unsafe Text within Natural Language Systems. | Alex Mei, Anisha Kabir, Sharon Levy, Melanie Subbiah, Emily Allaway, John Judge, Desmond Patton, Bruce Bimber, Kathleen R. McKeown, William Yang Wang |
| 2022 | LREC | Towards Understanding Gender-Seniority Compound Bias in Natural Language Generation. | Samhita Honnavalli, Aesha Parekh, Lily Ou, Sophie Groenwold, Sharon Levy, Vicente Ordonez, William Yang Wang |
| 2022 | WWW | Understanding Conflicts in Online Conversations. | Sharon Levy, Robert E. Kraut, Jane A. Yu, Kristen M. Altenburger, Yi-Chia Wang |
| 2021 | ACL | Investigating Memorization of Conspiracy Theories in Text Generation. | Sharon Levy, Michael Saxon, William Yang Wang |
| 2021 | EMNLP | Open-Domain Question-Answering for COVID-19 and Other Emergent Domains. | Sharon Levy, Kevin Mo, Wenhan Xiong, William Yang Wang |
| 2021 | EMNLP | Modeling Disclosive Transparency in NLP Application Descriptions. | Michael Saxon, Sharon Levy, Xinyi Wang, Alon Albalak, William Yang Wang |
| 2020 | EMNLP | Investigating African-American Vernacular English in Transformer-Based Text Generation. | Sophie Groenwold, Lily Ou, Aesha Parekh, Samhita Honnavalli, Sharon Levy, Diba Mirza, William Yang Wang |
| 2020 | LREC | Fakeddit: A New Multimodal Benchmark Dataset for Fine-grained Fake News Detection. | Kai Nakamura, Sharon Levy, William Yang Wang |