| 2026 | ACL | AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World Scenarios. | Lisa Alazraki, Lihu Chen, Ana Brassard, Joe Stacey, Hossein A. Rahmani, Marek Rei |
| 2026 | EACL | Improving the OOD Performance of Closed-Source LLMs on NLI Through Strategic Data Selection. | Joe Stacey, Lisa Alazraki, Aran Ubhi, Beyza Ermis, Aaron Mueller, Marek Rei |
| 2025 | SIGdial | PyTOD: Programmable Task-Oriented Dialogue with Execution Feedback. | Alexandru Coca, Bo-Hsiang Tseng, Peter Boothroyd, Jianpeng Cheng, Zhenxing Zhang, Mark Gaynor, Joe Stacey, Tristan Guigue, Hctor Martnez Alonso, Diarmuid Saghdha, Anders Johannsen |
| 2024 | ACL | Distilling Robustness into Natural Language Inference Models with Domain-Targeted Augmentation. | Joe Stacey, Marek Rei |
| 2024 | EMNLP | Atomic Inference for NLI with Generated Facts as Atoms. | Joe Stacey, Pasquale Minervini, Haim Dubossarsky, Oana-Maria Camburu, Marek Rei |
| 2024 | NAACL | LUCID: LLM-Generated Utterances for Complex and Interesting Dialogues. | Joe Stacey, Jianpeng Cheng, John Torr, Tristan Guigue, Joris Driesen, Alexandru Coca, Mark Gaynor, Anders Johannsen |
| 2023 | EMNLP | When and Why Does Bias Mitigation Work? | Abhilasha Ravichander, Joe Stacey, Marek Rei |
| 2022 | AAAI | Supervising Model Attention with Human Explanations for Robust Natural Language Inference. | Joe Stacey, Yonatan Belinkov, Marek Rei |
| 2022 | EMNLP | Logical Reasoning with Span-Level Predictions for Interpretable and Robust NLI Models. | Joe Stacey, Pasquale Minervini, Haim Dubossarsky, Marek Rei |
| 2020 | EMNLP | Avoiding the Hypothesis-Only Bias in Natural Language Inference via Ensemble Adversarial Training. | Joe Stacey, Pasquale Minervini, Haim Dubossarsky, Sebastian Riedel, Tim Rocktschel |