| 2026 | ACL | Rankify: A Comprehensive Python Toolkit for Retrieval, Re-Ranking, and Retrieval-Augmented Generation. | Abdelrahman Abdallah, Bhawna Piryani, Jamshid Mozafari, Andreas Herzinger, Jamie Holdcroft, Adam Jatowt |
| 2026 | ACL | Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring. | Jamshid Mozafari, Bhawna Piryani, Adam Jatowt |
| 2026 | ACL | It's High Time: A Survey of Temporal Question Answering. | Bhawna Piryani, Abdelrahman Abdallah, Jamshid Mozafari, Avishek Anand, Adam Jatowt |
| 2026 | WWW | Inferential Question Answering. | Jamshid Mozafari, Hamed Zamani, Guido Zuccon, Adam Jatowt |
| 2026 | SIGIR | Context Convergence Improves Answering Inferential Questions. | Jamshid Mozafari, Bhawna Piryani, Adam Jatowt |
| 2026 | SIGIR | Pretraining Exposure Explains Popularity Judgments in Large Language Models. | Jamshid Mozafari, Bhawna Piryani, Adam Jatowt |
| 2025 | CIKM | RerankArena: A Unified Platform for Evaluating Retrieval, Reranking and RAG with Human and LLM Feedback. | Abdelrahman Abdallah, Mahmoud Abdalla, Bhawna Piryani, Jamshid Mozafari, Mohammed Ali, Adam Jatowt |
| 2025 | CIKM | Evaluating Robustness of LLMs in Question Answering on Multilingual Noisy OCR Data. | Bhawna Piryani, Jamshid Mozafari, Abdelrahman Abdallah, Antoine Doucet, Adam Jatowt |
| 2025 | COLING | DynRank: Improve Passage Retrieval with Dynamic Zero-Shot Prompting Based on Question Classification. | Abdelrahman Abdallah, Jamshid Mozafari, Bhawna Piryani, Mohammed M. Abdelgwad, Adam Jatowt |
| 2025 | EMNLP | DeAR: Dual-Stage Document Reranking with Reasoning Agents via LLM Distillation. | Abdelrahman Abdallah, Jamshid Mozafari, Bhawna Piryani, Adam Jatowt |
| 2025 | EMNLP | How Good are LLM-based Rerankers? An Empirical Analysis of State-of-the-Art Reranking Models. | Abdelrahman Abdallah, Bhawna Piryani, Jamshid Mozafari, Mohammed Ali, Adam Jatowt |
| 2025 | NAACL | ASRank: Zero-Shot Re-Ranking with Answer Scent for Document Retrieval. | Abdelrahman Abdallah, Jamshid Mozafari, Bhawna Piryani, Adam Jatowt |
| 2025 | SIGIR | Wrong Answers Can Also Be Useful: PlausibleQA - A Large-Scale QA Dataset with Answer Plausibility Scores. | Jamshid Mozafari, Abdelrahman Abdallah, Bhawna Piryani, Adam Jatowt |
| 2025 | SIGIR | WikiHint: A Human-Annotated Dataset for Hint Ranking and Generation. | Jamshid Mozafari, Florian Gerhold, Adam Jatowt |
| 2024 | EMNLP | Exploring Hint Generation Approaches for Open-Domain Question Answering. | Jamshid Mozafari, Abdelrahman Abdallah, Bhawna Piryani, Adam Jatowt |
| 2024 | EMNLP | Detecting Temporal Ambiguity in Questions. | Bhawna Piryani, Abdelrahman Abdallah, Jamshid Mozafari, Adam Jatowt |
| 2024 | SIGIR | TriviaHG: A Dataset for Automatic Hint Generation from Factoid Questions. | Jamshid Mozafari, Anubhav Jangra, Adam Jatowt |
| 2024 | SIGIR | ChroniclingAmericaQA: A Large-scale Question Answering Dataset based on Historical American Newspaper Pages. | Bhawna Piryani, Jamshid Mozafari, Adam Jatowt |