Hisham Cholakkal
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
65
Venues
18
Active years
2013–2026
Best venue rank
A*
Where they publish
Papers
65 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation. | Jinxing Zhou, Yanghao Zhou, Mingfei Han, Tong Wang, Xiaojun Chang, Hisham Cholakkal, Rao Muhammad Anwer |
| 2026 | ACL | Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework. | Komal Kumar, Aman Chadha, Salman Khan, Fahad Shahbaz Khan, Hisham Cholakkal |
| 2026 | LREC | ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark. | Sara Ghaboura, Shubham Patle, Ketan More, Wafa Hamad Mohamed Alghallabi, Omkar Thawakar, Jorma Laaksonen, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer |
| 2026 | WACV | MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities. | Tooba Tehreem Sheikh, Jean Lahoud, Rao Muhammad Anwer, Fahad Shahbaz Khan, Salman Khan, Hisham Cholakkal |
| 2025 | ACL | Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts. | Sara Ghaboura, Ketan Pravin More, Ritesh Thawkar, Wafa Al Ghallabi, Omkar Thawakar, Fahad Shahbaz Khan, Hisham Cholakkal, Salman H. Khan, Rao Muhammad Anwer |
| 2025 | ACL | LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM. | Sambal Shikhar, Mohammed Irfan Kurpath, Sahal Shaji Mullappilly, Jean Lahoud, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman H. Khan, Hisham Cholakkal |
| 2025 | ACL | LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs. | Omkar Thawakar, Dinura Dissanayake, Ketan Pravin More, Ritesh Thawkar, Ahmed Heakl, Noor Ahsan, Yuhao Li, Mohammed Zumri, Jean Lahoud, Rao Muhammad Anwer, Hisham Cholakkal, Ivan Laptev, Mubarak Shah, Fahad Shahbaz Khan, Salman H. Khan |
| 2025 | CVPR | All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages. | Ashmal Vayani, Dinura Dissanayake, Hasindri Watawana, Noor Ahsan, Nevasini Sasikumar, Omkar Thawakar, Henok Biadglign Ademtew, Yahya Hmaiti, Amandeep Kumar, Kartik Kuckreja, Mykola Maslych, Wafa Al Ghallabi, Mihail Minkov Mihaylov, Chao Qin, Abdelrahman M. Shaker, Mike Zhang, Mahardika Krisna Ihsani, Amiel Gian Esplana, Monil Gokani, Shachar Mirkin, Harsh Singh, Ashay Srivastava, Endre Hamerlik, Fathinah Asma Izzati, Fadillah Adamsyah Maani, Sebastian Cavada, Jenny Chim, Rohit Gupta, Sanjay Manjunath, Kamila Zhumakhanova, Feno Heriniaina Rabevohitra, Azril Hafizi Amirudin, Muhammad Ridzuan, Daniya Najiha Abdul Kareem, Ketan Pravin More, Kunyang Li, Pramesh Shakya, Muhammad Saad, Amirpouya Ghasemaghaei, Amirbek Djanibekov, Dilshod Azizov, Branislava Jankovic, Naman Bhatia, Alvaro Cabrera, Johan S. Obando-Ceron, Olympiah Otieno, Fabian Farestam, Muztoba Rabbani, Sanoojan Baliah, Santosh Sanjeev, Abduragim Shtanchaev, Maheen Fatima, Thao Nguyen, Amrin Kareem, Toluwani Aremu, Nathan Augusto Zacarias Xavier, Amit Bhatkal, Hawau Olamide Toyin, Aman Chadha, Hisham Cholakkal, Rao Muhammad Anwer, Michael Felsberg, Jorma Laaksonen, Thamar Solorio, Monojit Choudhury, Ivan Laptev, Mubarak Shah, Salman H. Khan, Fahad Shahbaz Khan |
| 2025 | EMNLP | Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs. | Wafa Al Ghallabi, Ritesh Thawkar, Sara Ghaboura, Ketan Pravin More, Omkar Thawakar, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer |
| 2025 | EMNLP | MAviS: A Multimodal Conversational Assistant For Avian Species. | Yevheniia Kryklyvets, Mohammed Irfan Kurpath, Sahal Shaji Mullappilly, Jinxing Zhou, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman Khan, Hisham Cholakkal |
| 2025 | EMNLP | BiMediX2 : Bio-Medical EXpert LMM for Diverse Medical Modalities. | Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Sara Pieri, Saeed Yahya Alseiari, Shanavas Cholakkal, Khaled Aldahmani, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman H. Khan, Timothy Baldwin, Hisham Cholakkal |
| 2025 | EMNLP | A Culturally-diverse Multilingual Multimodal Video Benchmark & Model. | Bhuiyan Sanjid Shafique, Ashmal Vayani, Muhammad Maaz, Hanoona Abdul Rasheed, Dinura Dissanayake, Mohammed Irfan Kurpath, Yahya Hmaiti, Go Inoue, Jean Lahoud, Md. Safirur Rashid, Shadid Intisar Quasem, Maheen Fatima, Franco Vidal, Mykola Maslych, Ketan Pravin More, Sanoojan Baliah, Hasindri Watawana, Yuhao Li, Fabian Farestam, Leon Schaller, Roman Tymtsiv, Simon Weber, Hisham Cholakkal, Ivan Laptev, Shin'ichi Satoh, Michael Felsberg, Mubarak Shah, Salman H. Khan, Fahad Shahbaz Khan |
| 2025 | ICCV | Adapting In-Domain Few-Shot Segmentation to New Domains Without Source Domain Retraining. | Qi Fan, Kaiqi Liu, Nian Liu, Hisham Cholakkal, Rao Muhammad Anwer, Wenbin Li, Yang Gao |
| 2025 | ICCV | TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models. | Ziyang Luo, Nian Liu, Xuguang Yang, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Junwei Han |
| 2025 | ICLR | Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation. | Mohamed El Amine Boudjoghra, Angela Dai, Jean Lahoud, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Fahad Shahbaz Khan |
| 2025 | ICRA | Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking. | Ayesha Ishaq, Mohamed El Amine Boudjoghra, Jean Lahoud, Fahad Shahbaz Khan, Salman Khan, Hisham Cholakkal, Rao Muhammad Anwer |
| 2025 | IROS | DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding. | Ayesha Ishaq, Jean Lahoud, Ketan More, Omkar Thawakar, Ritesh Thawkar, Dinura Dissanayake, Noor Ahsan, Yuhao Li, Fahad Shahbaz Khan, Hisham Cholakkal, Ivan Laptev, Rao Muhammad Anwer, Salman H. Khan |
| 2025 | MICCAI | MedAgentSim: Self-evolving Multi-agent Simulations for Realistic Clinical Interactions. | Mohammed Khaleed Almansoori, Komal Kumar, Hisham Cholakkal |
| 2025 | WACV | AgroGPT : Efficient Agricultural Vision-Language Model with Expert Tuning. | Muhammad Awais, Ali Husain Salem Abdulla Alharthi, Amandeep Kumar, Hisham Cholakkal, Rao Muhammad Anwer |
| 2025 | WACV | Palo: A Polyglot Large Multimodal Model for 5B People. | Hanoona Abdul Rasheed, Muhammad Maaz, Abdelrahman M. Shaker, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Tim Baldwin, Michael Felsberg, Fahad Shahbaz Khan |
| 2024 | AAAI | Semi-supervised Open-World Object Detection. | Sahal Shaji Mullappilly, Abhishek Singh Gehlot, Rao Muhammad Anwer, Fahad Shahbaz Khan, Hisham Cholakkal |
| 2024 | CVPR | Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery. | Mubashir Noman, Muzammal Naseer, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Fahad Shahbaz Khan |
| 2024 | CVPR | GLaMM: Pixel Grounding Large Multimodal Model. | Hanoona Abdul Rasheed, Muhammad Maaz, Sahal Shaji Mullappilly, Abdelrahman M. Shaker, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Eric P. Xing, Ming-Hsuan Yang, Fahad Shahbaz Khan |
| 2024 | ECCV | Continual Learning and Unknown Object Discovery in 3D Scenes via Self-distillation. | Mohamed El Amine Boudjoghra, Jean Lahoud, Hisham Cholakkal, Rao Muhammad Anwer, Salman Khan, Fahad Shahbaz Khan |
| 2024 | ECCV | PARIS3D: Reasoning-Based 3D Part Segmentation Using Large Multimodal Model. | Amrin Kareem, Jean Lahoud, Hisham Cholakkal |
| 2024 | ECCV | Efficient 3D-Aware Facial Image Editing via Attribute-Specific Prompt Learning. | Amandeep Kumar, Muhammad Awais, Sanath Narayan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer |
| 2024 | ECCV | CONDA: Condensed Deep Association Learning for Co-salient Object Detection. | Long Li, Nian Liu, Dingwen Zhang, Zhongyu Li, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal, Junwei Han, Fahad Shahbaz Khan |
| 2024 | EMNLP | BiMediX: Bilingual Medical Mixture of Experts LLM. | Sara Pieri, Sahal Shaji Mullappilly, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman H. Khan, Timothy Baldwin, Hisham Cholakkal |
| 2024 | ICML | Bidirectional Reciprocative Information Communication for Few-Shot Semantic Segmentation. | Yuanwei Liu, Junwei Han, Xiwen Yao, Salman Khan, Hisham Cholakkal, Rao Muhammad Anwer, Nian Liu, Fahad Shahbaz Khan |
| 2024 | IGARSS | ChangeBind: A Hybrid Change Encoder for Remote Sensing Change Detection. | Mubahsir Noman, Mustansar Fiaz, Hisham Cholakkal |
| 2024 | ICRA | Long-Tailed 3D Semantic Segmentation with Adaptive Weight Constraint and Sampling. | Jean Lahoud, Fahad Shahbaz Khan, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan |
| 2024 | MICCAI | Decoupled Training for Semi-supervised Medical Image Segmentation with Worst-Case-Aware Learning. | Ankit Das, Chandan Gautam, Hisham Cholakkal, Pritee Agrawal, Feng Yang, Ramasamy Savitha, Yong Liu |
| 2024 | WACV | DDAM-PS: Diligent Domain Adaptive Mixer for Person Search. | Mohammed Khaleed Almansoori, Mustansar Fiaz, Hisham Cholakkal |
| 2024 | WACV | TransRadar: Adaptive-Directional Transformer for Real-Time Multi-View Radar Semantic Segmentation. | Yahia Dalbah, Jean Lahoud, Hisham Cholakkal |
| 2023 | BMVC | SA2-Net: Scale-aware Attention Network for Microscopic Image Segmentation. | Mustansar Fiaz, Moein Heidari, Rao Muhammad Anwer, Hisham Cholakkal |
| 2023 | CVPR | Person Image Synthesis via Denoising Diffusion Model. | Ankan Kumar Bhunia, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Jorma Laaksonen, Mubarak Shah, Fahad Shahbaz Khan |
| 2023 | CVPR | Discriminative Co-Saliency and Background Mining Transformer for Co-Salient Object Detection. | Long Li, Junwei Han, Ni Zhang, Nian Liu, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan |
| 2023 | EMNLP | Arabic Mini-ClimateGPT : A Climate Change and Sustainability Tailored Arabic LLM. | Sahal Shaji Mullappilly, Abdelrahman M. Shaker, Omkar Thawakar, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Fahad Shahbaz Khan |
| 2023 | ICCV | Generative Multiplane Neural Radiance for 3D-Aware Image Generation. | Amandeep Kumar, Ankan Kumar Bhunia, Sanath Narayan, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Ming-Hsuan Yang, Fahad Shahbaz Khan |
| 2023 | ICCV | Multi-grained Temporal Prototype Learning for Few-shot Video Object Segmentation. | Nian Liu, Kepan Nan, Wangbo Zhao, Yuanwei Liu, Xiwen Yao, Salman Khan, Hisham Cholakkal, Rao Muhammad Anwer, Junwei Han, Fahad Shahbaz Khan |
| 2023 | MICCAI | Cross-Modulated Few-Shot Image Generation for Colorectal Tissue Classification. | Amandeep Kumar, Ankan Kumar Bhunia, Sanath Narayan, Hisham Cholakkal, Rao Muhammad Anwer, Jorma Laaksonen, Fahad Shahbaz Khan |
| 2023 | WACV | SAT: Scale-Augmented Transformer for Person Search. | Mustansar Fiaz, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan |
| 2022 | ACCV | PS-ARM: An End-to-End Attention-Aware Relation Mixer Network for Person Search. | Mustansar Fiaz, Hisham Cholakkal, Sanath Narayan, Rao Muhammad Anwer, Fahad Shahbaz Khan |
| 2022 | BMVC | AVisT: A Benchmark for Visual Object Tracking in Adverse Visibility. | Mubashir Noman, Wafa Al Ghallabi, Daniya Kareem, Christoph Mayer, Akshay Dudhane, Martin Danelljan, Hisham Cholakkal, Salman Khan, Luc Van Gool, Fahad Shahbaz Khan |
| 2022 | CVPR | PSTR: End-to-End One-Step Person Search With Transformers. | Jiale Cao, Yanwei Pang, Rao Muhammad Anwer, Hisham Cholakkal, Jin Xie, Mubarak Shah, Fahad Shahbaz Khan |
| 2022 | ECCV | DoodleFormer: Creative Sketch Drawing with Transformers. | Ankan Kumar Bhunia, Salman Khan, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan, Jorma Laaksonen, Michael Felsberg |
| 2022 | ECCV | EdgeNeXt: Efficiently Amalgamated CNN-Transformer Architecture for Mobile Vision Applications. | Muhammad Maaz, Abdelrahman M. Shaker, Hisham Cholakkal, Salman H. Khan, Syed Waqas Zamir, Rao Muhammad Anwer, Fahad Shahbaz Khan |
| 2022 | ECCV | Video Instance Segmentation via Multi-Scale Spatio-Temporal Split Attention Transformer. | Omkar Thawakar, Sanath Narayan, Jiale Cao, Hisham Cholakkal, Rao Muhammad Anwer, Muhammad Haris Khan, Salman Khan, Michael Felsberg, Fahad Shahbaz Khan |
| 2021 | BMVC | Structured Latent Embeddings for Recognizing Unseen Classes in Unseen Domains. | Shivam Chandhok, Sanath Narayan, Hisham Cholakkal, Rao Muhammad Anwer, Vineeth N. Balasubramanian, Fahad Shahbaz Khan, Ling Shao |
| 2021 | ICCV | Handwriting Transformers. | Ankan Kumar Bhunia, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan, Mubarak Shah |
| 2021 | ICCV | D2-Net: Weakly-Supervised Action Localization via Discriminative Embeddings and Denoised Activations. | Sanath Narayan, Hisham Cholakkal, Munawar Hayat, Fahad Shahbaz Khan, Ming-Hsuan Yang, Ling Shao |
| 2020 | AAAI | Fine-Grained Recognition: Accounting for Subtle Differences between Similar Classes. | Guolei Sun, Hisham Cholakkal, Salman H. Khan, Fahad Shahbaz Khan, Ling Shao |
| 2020 | CVPR | D2Det: Towards High Quality Object Detection and Instance Segmentation. | Jiale Cao, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao |
| 2020 | ECCV | SipMask: Spatial Information Preservation for Fast Image and Video Instance Segmentation. | Jiale Cao, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao |
| 2020 | ECCV | Fixing Localization Errors to Improve Image Classification. | Guolei Sun, Salman H. Khan, Wen Li, Hisham Cholakkal, Fahad Shahbaz Khan, Luc Van Gool |
| 2020 | ECCV | Count- and Similarity-Aware R-CNN for Pedestrian Detection. | Jin Xie, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao, Mubarak Shah |
| 2019 | CVPR | Object Counting and Instance Segmentation With Image-Level Supervision. | Hisham Cholakkal, Guolei Sun, Fahad Shahbaz Khan, Ling Shao |
| 2019 | ICCV | 3C-Net: Category Count and Center Loss for Weakly-Supervised Action Localization. | Sanath Narayan, Hisham Cholakkal, Fahad Shahbaz Khan, Ling Shao |
| 2019 | ICCV | Enriched Feature Guided Refinement Network for Object Detection. | Jing Nie, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao |
| 2019 | ICCV | Learning Rich Features at High-Speed for Single-Shot Object Detection. | Tiancai Wang, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao |
| 2016 | CVPR | Backtracking ScSPM Image Classifier for Weakly Supervised Top-Down Saliency. | Hisham Cholakkal, Jubin Johnson, Deepu Rajan |
| 2015 | BMVC | Top-down saliency with Locality-constrained Contextual Sparse Coding. | Hisham Cholakkal, Deepu Rajan, Jubin Johnson |
| 2015 | VCIP | Temporal trimap propagation using motion-assisted shape blending. | Jubin Johnson, Deepu Rajan, Hisham Cholakkal |
| 2014 | BMVC | Sparse codes as Alpha Matte. | Jubin Johnson, Deepu Rajan, Hisham Cholakkal |
| 2013 | ASPDAC | High-level synthesis of multiple dependent CUDA kernels on FPGA. | Swathi T. Gurumani, Hisham Cholakkal, Yun Liang, Kyle Rupnow, Deming Chen |