| 2026 | EACL | Can LLMs reason over extended multilingual contexts? Towards long-context evaluation beyond retrieval over haystacks. | Amey Hengle, Prasoon Bajpai, Soham Dan, Tanmoy Chakraborty |
| 2025 | NAACL | Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language Models. | Amey Hengle, Prasoon Bajpai, Soham Dan, Tanmoy Chakraborty |
| 2025 | NAACL | CSEval: Towards Automated, Multi-Dimensional, and Reference-Free Counterspeech Evaluation using Auto-Calibrated LLMs. | Amey Hengle, Aswini Kumar Padhi, Anil Bandhakavi, Tanmoy Chakraborty |
| 2024 | EMNLP | Still Not Quite There! Evaluating Large Language Models for Comorbid Mental Health Diagnosis. | Amey Hengle, Atharva Kulkarni, Shantanu Patankar, Madhumitha Chandrasekaran, Sneha D'Silva, Jemima Jacob, Rashmi Gupta |
| 2024 | NAACL | Intent-conditioned and Non-toxic Counterspeech Generation using Multi-Task Instruction Tuning with RLAIF. | Amey Hengle, Aswini Kumar, Sahajpreet Singh, Anil Bandhakavi, Md. Shad Akhtar, Tanmoy Chakraborty |
| 2023 | EMNLP | Counting the Bugs in ChatGPT's Wugs: A Multilingual Investigation into the Morphological Capabilities of a Large Language Model. | Leonie Weissweiler, Valentin Hofmann, Anjali Kantharuban, Anna Cai, Ritam Dutt, Amey Hengle, Anubha Kabra, Atharva Kulkarni, Abhishek Vijayakumar, Haofei Yu, Hinrich Schtze, Kemal Oflazer, David R. Mortensen |