| 2026 | ACL | Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models. | Woody Haosheng Gan, Deqing Fu, Julian Asilis, Ollie Liu, Vatsal Sharan, Robin Jia, Willie Neiswanger |
| 2025 | ACL | Robust Data Watermarking in Language Models by Injecting Fictitious Knowledge. | Xinyue Cui, Johnny Tian-Zheng Wei, Swabha Swayamdipta, Robin Jia |
| 2025 | ACL | Verify with Caution: The Pitfalls of Relying on Imperfect Factuality Metrics. | Ameya Godbole, Robin Jia |
| 2025 | ACL | Mechanistic Interpretability of Emotion Inference in Large Language Models. | Ala N. Tak, Amin Banayeeanzade, Anahita Bolourani, Mina Kian, Robin Jia, Jonathan Gratch |
| 2025 | EMNLP | Why Do Some Inputs Break Low-Bit LLM Quantization? | Ting-Yun Chang, Muru Zhang, Jesse Thomason, Robin Jia |
| 2025 | EMNLP | TokenSmith: Streamlining Data Editing, Search, and Inspection for Large-Scale Language Model Training and Interpretability. | Mohammad Aflah Khan, Ameya Godbole, Johnny Tian-Zheng Wei, Ryan Yixiang Wang, James Flemings, Krishna P. Gummadi, Willie Neiswanger, Robin Jia |
| 2025 | EMNLP | Promote, Suppress, Iterate: How Language Models Answer One-to-Many Factual Queries. | Tianyi Lorena Yan, Robin Jia |
| 2025 | EMNLP | Rethinking Backdoor Detection Evaluation for Language Models. | Jun Yan, Wenjie Jacky Mo, Xiang Ren, Robin Jia |
| 2025 | ICLR | TLDR: Token-Level Detective Reward Model for Large Vision Language Models. | Deqing Fu, Tong Xiao, Rui Wang, Wang Zhu, Pengchuan Zhang, Guan Pang, Robin Jia, Lawrence Chen |
| 2025 | NAACL | Language Models Can Infer Action Semantics for Symbolic Planners from Environment Feedback. | Wang Bill Zhu, Ishika Singh, Robin Jia, Jesse Thomason |
| 2024 | ACL | Proving membership in LLM pretraining data via data watermarks. | Johnny Tian-Zheng Wei, Ryan Yixiang Wang, Robin Jia |
| 2024 | AIES | Operationalizing Content Moderation "Accuracy" in the Digital Services Act. | Johnny Tian-Zheng Wei, Frederike Zufall, Robin Jia |
| 2024 | EMNLP | When Parts Are Greater Than Sums: Individual LLM Components Can Outperform Full Models. | Ting-Yun Chang, Jesse Thomason, Robin Jia |
| 2024 | NAACL | Efficient End-to-End Visual Document Understanding with Rationale Distillation. | Wang Zhu, Alekh Agarwal, Mandar Joshi, Robin Jia, Jesse Thomason, Kristina Toutanova |
| 2024 | NAACL | Do Localization Methods Actually Localize Memorized Data in LLMs? A Tale of Two Benchmarks. | Ting-Yun Chang, Jesse Thomason, Robin Jia |
| 2023 | ACL | Data Curation Alone Can Stabilize In-context Learning. | Ting-Yun Chang, Robin Jia |
| 2023 | ACL | Are Sample-Efficient NLP Models More Robust? | Nelson F. Liu, Ananya Kumar, Percy Liang, Robin Jia |
| 2023 | ACL | Do Question Answering Modeling Improvements Hold Across Benchmarks? | Nelson F. Liu, Tony Lee, Robin Jia, Percy Liang |
| 2023 | ACL | Contrastive Novelty-Augmented Learning: Anticipating Outliers with Large Language Models. | Albert Xu, Xiang Ren, Robin Jia |
| 2023 | EACL | Benchmarking Long-tail Generalization with Likelihood Splits. | Ameya Godbole, Robin Jia |
| 2023 | EMNLP | Chain-of-Questions Training with Latent Answers for Robust Multistep Question Answering. | Wang Zhu, Jesse Thomason, Robin Jia |
| 2023 | EMNLP | SCENE: Self-Labeled Counterfactuals for Extrapolating to Negative Examples. | Deqing Fu, Ameya Godbole, Robin Jia |
| 2023 | EMNLP | Estimating Large Language Model Capabilities without Labeled Test Data. | Harvey Yiyun Fu, Qinyuan Ye, Albert Xu, Xiang Ren, Robin Jia |
| 2023 | EMNLP | How Predictable Are Large Language Model Capabilities? A Case Study on BIG-bench. | Qinyuan Ye, Harvey Yiyun Fu, Xiang Ren, Robin Jia |
| 2022 | ACL | Question Answering Infused Pre-training of General-Purpose Contextualized Representations. | Robin Jia, Mike Lewis, Luke Zettlemoyer |
| 2022 | ACL | On Continual Model Refinement in Out-of-Distribution Data Streams. | Bill Yuchen Lin, Sida Wang, Xi Victoria Lin, Robin Jia, Lin Xiao, Xiang Ren, Scott Yih |
| 2022 | ACL | Analyzing Dynamic Adversarial Training Data in the Limit. | Eric Wallace, Adina Williams, Robin Jia, Douwe Kiela |
| 2022 | EMNLP | Generalization Differences between End-to-End and Neuro-Symbolic Vision-Language Reasoning Systems. | Wang Zhu, Jesse Thomason, Robin Jia |
| 2022 | ICML | Knowledge Base Question Answering by Case-based Reasoning over Subgraphs. | Rajarshi Das, Ameya Godbole, Ankita Naik, Elliot Tower, Manzil Zaheer, Hannaneh Hajishirzi, Robin Jia, Andrew McCallum |
| 2022 | NAACL | Models in the Loop: Aiding Crowdworkers with Generative Annotation Assistants. | Max Bartolo, Tristan Thrush, Sebastian Riedel, Pontus Stenetorp, Robin Jia, Douwe Kiela |
| 2022 | NAACL | On the Robustness of Reading Comprehension Models to Entity Renaming. | Jun Yan, Yang Xiao, Sagnik Mukherjee, Bill Yuchen Lin, Robin Jia, Xiang Ren |
| 2021 | ACL | Do Explanations Help Users Detect Errors in Open-Domain QA? An Evaluation of Spoken vs. Visual Explanations. | Ana Valeria Gonzalez, Gagan Bansal, Angela Fan, Yashar Mehdad, Robin Jia, Srinivasan Iyer |
| 2021 | ACL | Evaluation Examples are not Equally Informative: How should that change NLP Leaderboards? | Pedro Rodriguez, Joe Barrow, Alexander Miserlis Hoyle, John P. Lalor, Robin Jia, Jordan L. Boyd-Graber |
| 2021 | ACL | The statistical advantage of automatic NLG metrics at the system level. | Johnny Tian-Zheng Wei, Robin Jia |
| 2021 | EMNLP | Improving Question Answering Model Robustness with Synthetic Adversarial Data Generation. | Max Bartolo, Tristan Thrush, Robin Jia, Sebastian Riedel, Pontus Stenetorp, Douwe Kiela |
| 2021 | EMNLP | Robustness and Adversarial Examples in Natural Language Processing. | Kai-Wei Chang, He He, Robin Jia, Sameer Singh |
| 2021 | EMNLP | Masked Language Modeling and the Distributional Hypothesis: Order Word Matters Pre-training for Little. | Koustuv Sinha, Robin Jia, Dieuwke Hupkes, Joelle Pineau, Adina Williams, Douwe Kiela |
| 2021 | NAACL | Dynabench: Rethinking Benchmarking in NLP. | Douwe Kiela, Max Bartolo, Yixin Nie, Divyansh Kaushik, Atticus Geiger, Zhengxuan Wu, Bertie Vidgen, Grusha Prasad, Amanpreet Singh, Pratik Ringshia, Zhiyi Ma, Tristan Thrush, Sebastian Riedel, Zeerak Waseem, Pontus Stenetorp, Robin Jia, Mohit Bansal, Christopher Potts, Adina Williams |
| 2021 | NAACL | Swords: A Benchmark for Lexical Substitution with Improved Data Coverage and Quality. | Mina Lee, Chris Donahue, Robin Jia, Alexander Iyabor, Percy Liang |
| 2020 | ACL | Robust Encodings: A Framework for Combating Adversarial Typos. | Erik Jones, Robin Jia, Aditi Raghunathan, Percy Liang |
| 2020 | ACL | Selective Question Answering under Domain Shift. | Amita Kamath, Robin Jia, Percy Liang |
| 2020 | EMNLP | With Little Power Comes Great Responsibility. | Dallas Card, Peter Henderson, Urvashi Khandelwal, Robin Jia, Kyle Mahowald, Dan Jurafsky |
| 2020 | EMNLP | On the Importance of Adaptive Data Collection for Extremely Imbalanced Pairwise Tasks. | Stephen Mussmann, Robin Jia, Percy Liang |
| 2019 | EMNLP | Certified Robustness to Adversarial Word Substitutions. | Robin Jia, Aditi Raghunathan, Kerem Gksel, Percy Liang |
| 2019 | NAACL | Document-Level N-ary Relation Extraction with Multiscale Representation Learning. | Robin Jia, Cliff Wong, Hoifung Poon |
| 2018 | ACL | Know What You Don't Know: Unanswerable Questions for SQuAD. | Pranav Rajpurkar, Robin Jia, Percy Liang |
| 2018 | NAACL | Delete, Retrieve, Generate: a Simple Approach to Sentiment and Style Transfer. | Juncen Li, Robin Jia, He He, Percy Liang |
| 2017 | EMNLP | Adversarial Examples for Evaluating Reading Comprehension Systems. | Robin Jia, Percy Liang |
| 2017 | ICASSP | Learning concepts through conversations in spoken dialogue systems. | Robin Jia, Larry P. Heck, Dilek Hakkani-Tr, Georgi Nikolov |
| 2016 | ACL | Data Recombination for Neural Semantic Parsing. | Robin Jia, Percy Liang |