Skip to content

Jordan Lee Boyd-Graber

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

22

Venues

5

Active years

2025–2026

Best venue rank

A*

Where they publish

Papers

22 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLLanguage Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users.Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik
2026ACLBenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks.Nishant Balepur, Bhavya Rajasekaran, Hyunjin Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber
2026ACLAI, Take the Wheel: What Drives Delegation and Trust in Human-Computer Cooperative Question Answering?Maharshi Gor, Yoo Yeon Sung, Yu Hou, Eve Fleisig, Zhu Irene Ying, Tianyi Zhou, Jordan Lee Boyd-Graber
2026ACLLarge Language Models Are Effective Human Annotation Assistants, But Not Good Independent Annotators.Feng Gu, Zongxia Li, Carlos Rafael Colon, Benjamin Evans, Ishani Mondal, Jordan Lee Boyd-Graber
2026ACLMeasuring User's Mental Models of Speech Translation in Human-AI Collaboration.Hyojung Han, Nishant Balepur, Jordan Lee Boyd-Graber, Marine Carpuat
2026ACLAUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA.Tasnim Kabir, Dmytro Kurdydyk, Aadi Palnitkar, Liam Dorn, Ahmed Haj Ahmed, Jordan Lee Boyd-Graber
2026EACLSMART-Editor: A Multi-Agent Framework for Human-Like Design Editing with Structural Integrity.Ishani Mondal, Meera Bharadwaj, Ayush Roy, Aparna Garimella, Jordan Lee Boyd-Graber
2025ACLWhose Boat Does it Float? Improving Personalization in Preference Tuning via Inferred User Personas.Nishant Balepur, Vishakh Padmakumar, Fumeng Yang, Shi Feng, Rachel Rudinger, Jordan Lee Boyd-Graber
2025ACLWhich of These Best Describes Multiple Choice Evaluation with LLMs? A) Forced B) Flawed C) Fixable D) All of the Above.Nishant Balepur, Rachel Rudinger, Jordan Lee Boyd-Graber
2025ACLProxAnn: Use-Oriented Evaluations of Topic Models and Document Clustering.Alexander Miserlis Hoyle, Lorena Calvo-Bartolom, Jordan Lee Boyd-Graber, Philip Resnik
2025ACLLarge Language Models Struggle to Describe the Haystack without Human Help: A Social Science-Inspired Evaluation of Topic Models.Zongxia Li, Lorena Calvo-Bartolom, Alexander Miserlis Hoyle, Paiheng Xu, Daniel Kofi Stephens, Juan Francisco Fung, Alden Dima, Jordan Lee Boyd-Graber
2025ACLNo Questions are Stupid, but some are Poorly Posed: Understanding Poorly-Posed Information-Seeking Questions.Neha Srikanth, Rachel Rudinger, Jordan Lee Boyd-Graber
2025ACLGRACE: A Granular Benchmark for Evaluating Model Calibration against Human Calibration.Yoo Yeon Sung, Eve Fleisig, Yu Hou, Ishan Upadhyay, Jordan Lee Boyd-Graber
2025ACLShould I Trust You? Detecting Deception in Negotiations using Counterfactual RL.Wichayaporn Wongkamjan, Yanze Wang, Feng Gu, Denis Peskoff, Jonathan K. Kummerfeld, Jonathan May, Jordan Lee Boyd-Graber
2025COLINGADAPTIVE IE: Investigating the Complementarity of Human-AI Collaboration to Adaptively Extract Information on-the-fly.Ishani Mondal, Michelle Yuan, Anandhavelu Natarajan, Aparna Garimella, Francis Ferraro, Andrew Blair-Stanek, Benjamin Van Durme, Jordan Lee Boyd-Graber
2025EMNLPA Good Plan is Hard to Find: Aligning Models with Preferences is Misaligned with What Helps Users.Nishant Balepur, Matthew Shu, Yoo Yeon Sung, Seraphina Goldfarb-Tarrant, Shi Feng, Fumeng Yang, Rachel Rudinger, Jordan Lee Boyd-Graber
2025EMNLPDiscrepancy Detection at the Data Level: Toward Consistent Multilingual Question Answering.Lorena Calvo-Bartolom, Valrie Aldana, Karla Cantarero, Alonso Madroal de Mesa, Jernimo Arenas-Garca, Jordan Lee Boyd-Graber
2025EMNLPGroup Preference Alignment: Customizing LLM Responses from In-Situ Conversations Only When Needed.Ishani Mondal, Jack W. Stokes, Sujay Kumar Jauhar, Longqi Yang, Mengting Wan, Xiaofeng Xu, Xia Song, Jordan Lee Boyd-Graber, Jennifer Neville
2025NAACLReverse Question Answering: Can an LLM Write a Question so Hard (or Bad) that it Can't Answer?Nishant Balepur, Feng Gu, Abhilasha Ravichander, Shi Feng, Jordan Lee Boyd-Graber, Rachel Rudinger
2025NAACLMoDS: Moderating a Mixture of Document Speakers to Summarize Debatable Queries in Document Collections.Nishant Balepur, Alexa F. Siu, Nedim Lipka, Franck Dernoncourt, Tong Sun, Jordan Lee Boyd-Graber, Puneet Mathur
2025NAACLPersonalized Help for Optimizing Low-Skilled Users' Strategy.Feng Gu, Wichayaporn Wongkamjan, Jordan Lee Boyd-Graber, Jonathan K. Kummerfeld, Denis Peskoff, Jonathan May
2025NAACLIs your benchmark truly adversarial? AdvScore: Evaluating Human-Grounded Adversarialness.Yoo Yeon Sung, Maharshi Gor, Eve Fleisig, Ishani Mondal, Jordan Lee Boyd-Graber