Jordan Lee Boyd-Graber
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
22
Venues
5
Active years
2025–2026
Best venue rank
A*
Where they publish
Papers
22 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users. | Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik |
| 2026 | ACL | BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks. | Nishant Balepur, Bhavya Rajasekaran, Hyunjin Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber |
| 2026 | ACL | AI, Take the Wheel: What Drives Delegation and Trust in Human-Computer Cooperative Question Answering? | Maharshi Gor, Yoo Yeon Sung, Yu Hou, Eve Fleisig, Zhu Irene Ying, Tianyi Zhou, Jordan Lee Boyd-Graber |
| 2026 | ACL | Large Language Models Are Effective Human Annotation Assistants, But Not Good Independent Annotators. | Feng Gu, Zongxia Li, Carlos Rafael Colon, Benjamin Evans, Ishani Mondal, Jordan Lee Boyd-Graber |
| 2026 | ACL | Measuring User's Mental Models of Speech Translation in Human-AI Collaboration. | Hyojung Han, Nishant Balepur, Jordan Lee Boyd-Graber, Marine Carpuat |
| 2026 | ACL | AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA. | Tasnim Kabir, Dmytro Kurdydyk, Aadi Palnitkar, Liam Dorn, Ahmed Haj Ahmed, Jordan Lee Boyd-Graber |
| 2026 | EACL | SMART-Editor: A Multi-Agent Framework for Human-Like Design Editing with Structural Integrity. | Ishani Mondal, Meera Bharadwaj, Ayush Roy, Aparna Garimella, Jordan Lee Boyd-Graber |
| 2025 | ACL | Whose Boat Does it Float? Improving Personalization in Preference Tuning via Inferred User Personas. | Nishant Balepur, Vishakh Padmakumar, Fumeng Yang, Shi Feng, Rachel Rudinger, Jordan Lee Boyd-Graber |
| 2025 | ACL | Which of These Best Describes Multiple Choice Evaluation with LLMs? A) Forced B) Flawed C) Fixable D) All of the Above. | Nishant Balepur, Rachel Rudinger, Jordan Lee Boyd-Graber |
| 2025 | ACL | ProxAnn: Use-Oriented Evaluations of Topic Models and Document Clustering. | Alexander Miserlis Hoyle, Lorena Calvo-Bartolom, Jordan Lee Boyd-Graber, Philip Resnik |
| 2025 | ACL | Large Language Models Struggle to Describe the Haystack without Human Help: A Social Science-Inspired Evaluation of Topic Models. | Zongxia Li, Lorena Calvo-Bartolom, Alexander Miserlis Hoyle, Paiheng Xu, Daniel Kofi Stephens, Juan Francisco Fung, Alden Dima, Jordan Lee Boyd-Graber |
| 2025 | ACL | No Questions are Stupid, but some are Poorly Posed: Understanding Poorly-Posed Information-Seeking Questions. | Neha Srikanth, Rachel Rudinger, Jordan Lee Boyd-Graber |
| 2025 | ACL | GRACE: A Granular Benchmark for Evaluating Model Calibration against Human Calibration. | Yoo Yeon Sung, Eve Fleisig, Yu Hou, Ishan Upadhyay, Jordan Lee Boyd-Graber |
| 2025 | ACL | Should I Trust You? Detecting Deception in Negotiations using Counterfactual RL. | Wichayaporn Wongkamjan, Yanze Wang, Feng Gu, Denis Peskoff, Jonathan K. Kummerfeld, Jonathan May, Jordan Lee Boyd-Graber |
| 2025 | COLING | ADAPTIVE IE: Investigating the Complementarity of Human-AI Collaboration to Adaptively Extract Information on-the-fly. | Ishani Mondal, Michelle Yuan, Anandhavelu Natarajan, Aparna Garimella, Francis Ferraro, Andrew Blair-Stanek, Benjamin Van Durme, Jordan Lee Boyd-Graber |
| 2025 | EMNLP | A Good Plan is Hard to Find: Aligning Models with Preferences is Misaligned with What Helps Users. | Nishant Balepur, Matthew Shu, Yoo Yeon Sung, Seraphina Goldfarb-Tarrant, Shi Feng, Fumeng Yang, Rachel Rudinger, Jordan Lee Boyd-Graber |
| 2025 | EMNLP | Discrepancy Detection at the Data Level: Toward Consistent Multilingual Question Answering. | Lorena Calvo-Bartolom, Valrie Aldana, Karla Cantarero, Alonso Madroal de Mesa, Jernimo Arenas-Garca, Jordan Lee Boyd-Graber |
| 2025 | EMNLP | Group Preference Alignment: Customizing LLM Responses from In-Situ Conversations Only When Needed. | Ishani Mondal, Jack W. Stokes, Sujay Kumar Jauhar, Longqi Yang, Mengting Wan, Xiaofeng Xu, Xia Song, Jordan Lee Boyd-Graber, Jennifer Neville |
| 2025 | NAACL | Reverse Question Answering: Can an LLM Write a Question so Hard (or Bad) that it Can't Answer? | Nishant Balepur, Feng Gu, Abhilasha Ravichander, Shi Feng, Jordan Lee Boyd-Graber, Rachel Rudinger |
| 2025 | NAACL | MoDS: Moderating a Mixture of Document Speakers to Summarize Debatable Queries in Document Collections. | Nishant Balepur, Alexa F. Siu, Nedim Lipka, Franck Dernoncourt, Tong Sun, Jordan Lee Boyd-Graber, Puneet Mathur |
| 2025 | NAACL | Personalized Help for Optimizing Low-Skilled Users' Strategy. | Feng Gu, Wichayaporn Wongkamjan, Jordan Lee Boyd-Graber, Jonathan K. Kummerfeld, Denis Peskoff, Jonathan May |
| 2025 | NAACL | Is your benchmark truly adversarial? AdvScore: Evaluating Human-Grounded Adversarialness. | Yoo Yeon Sung, Maharshi Gor, Eve Fleisig, Ishani Mondal, Jordan Lee Boyd-Graber |