| 2025 | COLING | AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment. | Umair Nawaz, Muhammad Awais, Hanan Gani, Muzammal Naseer, Fahad Shahbaz Khan, Salman H. Khan, Rao Muhammad Anwer |
| 2025 | CVPR | VideoGLaMM : A Large Multimodal Model for Pixel-Level Visual Grounding in Videos. | Shehan Munasinghe, Hanan Gani, Wenqi Zhu, Jiale Cao, Eric P. Xing, Fahad Shahbaz Khan, Salman H. Khan |
| 2025 | ICCV | Aurelia: Test-Time Reasoning Distillation in Audio-Visual LLMs. | Sanjoy Chowdhury, Hanan Gani, Nishit Anand, Sayan Nag, Ruohan Gao, Mohamed Elhoseiny, Salman Khan, Dinesh Manocha |
| 2025 | NAACL | VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs. | Hanan Gani, Rohit Bharadwaj, Muzammal Naseer, Fahad Shahbaz Khan, Salman Khan |
| 2025 | WACV | Test-Time Low Rank Adaptation via Confidence Maximization for Zero-Shot Generalization of Vision-Language Models. | Raza Imam, Hanan Gani, Muhammad Huzaifa, Karthik Nandakumar |
| 2024 | ICIP | Multi-Attribute Vision Transformers are Efficient and Robust Learners. | Hanan Gani, Nada Saadi, Noor Hussein, Karthik Nandakumar |
| 2024 | ICLR | LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts. | Hanan Gani, Shariq Farooq Bhat, Muzammal Naseer, Salman Khan, Peter Wonka |
| 2024 | MICCAI | MedContext: Learning Contextual Cues for Efficient Volumetric Medical Segmentation. | Hanan Gani, Muzammal Naseer, Fahad Khan, Salman H. Khan |
| 2022 | BMVC | How to Train Vision Transformer on Small-scale Datasets? | Hanan Gani, Muzammal Naseer, Mohammad Yaqub |