| 2026 | ACL | Large Language Models Are Effective Human Annotation Assistants, But Not Good Independent Annotators. | Feng Gu, Zongxia Li, Carlos Rafael Colon, Benjamin Evans, Ishani Mondal, Jordan Lee Boyd-Graber |
| 2025 | ACL | Large Language Models Struggle to Describe the Haystack without Human Help: A Social Science-Inspired Evaluation of Topic Models. | Zongxia Li, Lorena Calvo-Bartolom, Alexander Miserlis Hoyle, Paiheng Xu, Daniel Kofi Stephens, Juan Francisco Fung, Alden Dima, Jordan Lee Boyd-Graber |
| 2025 | CVPR | A Survey of State of the Art Large Vision Language Models: Benchmark Evaluations and Challenges. | Zongxia Li, Xiyang Wu, Hongyang Du, Fuxiao Liu, Huy Nghiem, Guangyao Shi |
| 2024 | ACL | Do Large Language Models Discriminate in Hiring Decisions on the Basis of Race, Ethnicity, and Gender? | Haozhe An, Christabel Acquaye, Colin Wang, Zongxia Li, Rachel Rudinger |
| 2024 | CVPR | Hallusionbench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models. | Tianrui Guan, Fuxiao Liu, Xiyang Wu, Ruiqi Xian, Zongxia Li, Xiaoyu Liu, Xijun Wang, Lichang Chen, Furong Huang, Yaser Yacoob, Dinesh Manocha, Tianyi Zhou |
| 2024 | EACL | Improving the TENOR of Labeling: Re-evaluating Topic Models for Content Analysis. | Zongxia Li, Andrew Mao, Daniel Kofi Stephens, Pranav Goel, Emily Walpole, Alden Dima, Juan Fung, Jordan L. Boyd-Graber |
| 2024 | EMNLP | PEDANTS: Cheap but Effective and Interpretable Answer Equivalence. | Zongxia Li, Ishani Mondal, Huy Nghiem, Yijun Liang, Jordan L. Boyd-Graber |
| 2024 | EMNLP | SciDoc2Diagrammer-MAF: Towards Generation of Scientific Diagrams from Documents guided by Multi-Aspect Feedback Refinement. | Ishani Mondal, Zongxia Li, Yufang Hou, Anandhavelu Natarajan, Aparna Garimella, Jordan L. Boyd-Graber |
| 2023 | EACL | SODAPOP: Open-Ended Discovery of Social Biases in Social Commonsense Reasoning Models. | Haozhe An, Zongxia Li, Jieyu Zhao, Rachel Rudinger |