| 2026 | ACL | SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA. | Sher Badshah, Ali Emami, Hassan Sajjad |
| 2026 | ACL | If Only My CGM Could Speak: A Privacy-Preserving Agent for Question Answering over Continuous Glucose Data. | Yanjun Cui, Ali Emami, Temiloluwa Prioleau, Nikhil Singh |
| 2026 | ACL | Reasoning Traces Shape Outputs but Models Won't Say So. | Yijie Hao, Lingjie Chen, Ali Emami, Joyce C. Ho |
| 2026 | ACL | Common to Whom? Regional Cultural Commonsense and LLM Bias in India. | Sangmitra Madhusudan, Trush Shashank More, Steph Buongiorno, Renata Dividino, Jad Kabbara, Ali Emami |
| 2026 | ACL | DART: Mitigating Harm Drift in Difference-Aware LLMs via Distill-Audit-Repair Training. | Ziwen Pan, Zihan Liang, Jad Kabbara, Ali Emami |
| 2026 | ACL | Memory Dial: A Training Framework for Controllable Memorization in Language Models. | Xiangbo Zhang, Ali Emami |
| 2026 | EACL | The Dog the Cat Chased Stumped the Model: Measuring When Language Models Abandon Structure for Shortcuts. | Sangmitra Madhusudan, Kaige Chen, Ali Emami |
| 2025 | ACL | Translate With Care: Addressing Gender Bias, Neutrality, and Reasoning in Large Language Model Translations. | Pardis Sadat Zahraei, Ali Emami |
| 2025 | COLING | NYT-Connections: A Deceptively Simple Text Classification Task that Stumps System-1 Thinkers. | Angel Yahir Loredo Lopez, Tyler McDonald, Ali Emami |
| 2025 | COLING | Can We Afford The Perfect Prompt? Balancing Cost and Accuracy with the Economical Prompting Index. | Tyler McDonald, Anthony Colosimo, Yifeng Li, Ali Emami |
| 2025 | EMNLP | We Politely Insist: Your LLM Must Learn the Persian Art of Taarof. | Nikta Gohari Sadr, Sahar Heidariasl, Karine Megerdoomian, Laleh Seyyed-Kalantari, Ali Emami |
| 2025 | EMNLP | Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models. | Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata |
| 2025 | EMNLP | Personality Matters: User Traits Predict LLM Preferences in Multi-Turn Collaborative Tasks. | Sarfaroz Yunusov, Kaige Chen, Kazi Nishat Anwar, Ali Emami |
| 2025 | NAACL | Fine-Tuned LLMs are "Time Capsules" for Tracking Societal Bias Through Books. | Sangmitra Madhusudan, Robert Morabito, Skye Reid, Nikta Gohari Sadr, Ali Emami |
| 2024 | ACL | Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models. | Abhishek Kumar, Robert Morabito, Sanzhar Umbet, Jad Kabbara, Ali Emami |
| 2024 | ACL | Subtle Biases Need Subtler Measures: Dual Metrics for Evaluating Representative and Affinity Bias in Large Language Models. | Abhishek Kumar, Sarfaroz Yunusov, Ali Emami |
| 2024 | ACL | Trace-of-Thought Prompting: Investigating Prompt-Based Knowledge Distillation Through Question Decomposition. | Tyler McDonald, Ali Emami |
| 2024 | ACL | Picturing Ambiguity: A Visual Twist on the Winograd Schema Challenge. | Brendan Park, Madeline Janecek, Naser Ezzati-Jivan, Yifeng Li, Ali Emami |
| 2024 | COLING | EvoGrad: A Dynamic Take on the Winograd Schema Challenge with Human Adversaries. | Jing Han Sun, Ali Emami |
| 2024 | EACL | WSC+: Enhancing The Winograd Schema Challenge Using Tree-of-Experts. | Pardis Sadat Zahraei, Ali Emami |
| 2024 | EMNLP | STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions. | Robert Morabito, Sangmitra Madhusudan, Tyler McDonald, Ali Emami |
| 2024 | EMNLP | MirrorStories: Reflecting Diversity through Personalized Narrative Generation with Large Language Models. | Sarfaroz Yunusov, Hamza Sidat, Ali Emami |
| 2023 | ACL | The Turing Quest: Can Transformers Make Good NPCs? | Qi Chen Gao, Ali Emami |
| 2023 | ACL | Debiasing should be Good and Bad: Measuring the Consistency of Debiasing Techniques in Language Models. | Robert Morabito, Jad Kabbara, Ali Emami |
| 2021 | ACL | ADEPT: An Adjective-Dependent Plausibility Task. | Ali Emami, Ian Porada, Alexandra Olteanu, Kaheer Suleman, Adam Trischler, Jackie Chi Kit Cheung |
| 2020 | COLING | An Analysis of Dataset Overlap on Winograd-Style Tasks. | Ali Emami, Kaheer Suleman, Adam Trischler, Jackie Chi Kit Cheung |
| 2019 | ACL | The KnowRef Coreference Corpus: Removing Gender and Number Cues for Difficult Pronominal Anaphora Resolution. | Ali Emami, Paul Trichelair, Adam Trischler, Kaheer Suleman, Hannes Schulz, Jackie Chi Kit Cheung |
| 2019 | EMNLP | How Reasonable are Common-Sense Reasoning Tasks: A Case-Study on the Winograd Schema Challenge and SWAG. | Paul Trichelair, Ali Emami, Adam Trischler, Kaheer Suleman, Jackie Chi Kit Cheung |
| 2019 | ICASSP | Exploiting Uncertainty of Deep Neural Networks for Improving Segmentation Accuracy in MRI Images. | Alireza Norouzi, Ali Emami, Kayvan Najarian, Nader Karimi, Shadrokh Samavi, S. M. Reza Soroushmehr |
| 2018 | EMNLP | A Knowledge Hunting Framework for Common Sense Reasoning. | Ali Emami, Noelia De La Cruz, Adam Trischler, Kaheer Suleman, Jackie Chi Kit Cheung |
| 2018 | NAACL | A Generalized Knowledge Hunting Framework for the Winograd Schema Challenge. | Ali Emami, Adam Trischler, Kaheer Suleman, Jackie Chi Kit Cheung |
| 2012 | AVSS | Role of Spatiotemporal Oriented Energy Features for Robust Visual Tracking in Video Surveillance. | Ali Emami, Farhad Dadgostar, Abbas Bigdeli, Brian C. Lovell |
| 2010 | DICTA | High Throughput Variable Size Non-square Gabor Engine with Feature Pooling Based on GPU. | Ali Emami, Abbas Bigdeli, Adam Postula |