Rao Muhammad Anwer
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
72
Venues
21
Active years
2011–2026
Best venue rank
A*
Where they publish
Papers
72 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation. | Jinxing Zhou, Yanghao Zhou, Mingfei Han, Tong Wang, Xiaojun Chang, Hisham Cholakkal, Rao Muhammad Anwer |
| 2026 | EACL | DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding. | Shubham Patle, Sara Ghaboura, Hania Tariq, Mohammad Usman Khan, Omkar Thawakar, Rao Muhammad Anwer, Salman H. Khan |
| 2026 | LREC | ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark. | Sara Ghaboura, Shubham Patle, Ketan More, Wafa Hamad Mohamed Alghallabi, Omkar Thawakar, Jorma Laaksonen, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer |
| 2026 | LREC | AgriChain: Visually-Grounded Expert-Verified Reasoning for Interpretable Agricultural Vision-Language Models. | Hazza Mahmood, Yongqiang Yu, Rao Muhammad Anwer |
| 2026 | WACV | MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities. | Tooba Tehreem Sheikh, Jean Lahoud, Rao Muhammad Anwer, Fahad Shahbaz Khan, Salman Khan, Hisham Cholakkal |
| 2025 | ACL | Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts. | Sara Ghaboura, Ketan Pravin More, Ritesh Thawkar, Wafa Al Ghallabi, Omkar Thawakar, Fahad Shahbaz Khan, Hisham Cholakkal, Salman H. Khan, Rao Muhammad Anwer |
| 2025 | ACL | LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM. | Sambal Shikhar, Mohammed Irfan Kurpath, Sahal Shaji Mullappilly, Jean Lahoud, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman H. Khan, Hisham Cholakkal |
| 2025 | ACL | LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs. | Omkar Thawakar, Dinura Dissanayake, Ketan Pravin More, Ritesh Thawkar, Ahmed Heakl, Noor Ahsan, Yuhao Li, Mohammed Zumri, Jean Lahoud, Rao Muhammad Anwer, Hisham Cholakkal, Ivan Laptev, Mubarak Shah, Fahad Shahbaz Khan, Salman H. Khan |
| 2025 | COLING | AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment. | Umair Nawaz, Muhammad Awais, Hanan Gani, Muzammal Naseer, Fahad Shahbaz Khan, Salman H. Khan, Rao Muhammad Anwer |
| 2025 | CVPR | All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages. | Ashmal Vayani, Dinura Dissanayake, Hasindri Watawana, Noor Ahsan, Nevasini Sasikumar, Omkar Thawakar, Henok Biadglign Ademtew, Yahya Hmaiti, Amandeep Kumar, Kartik Kuckreja, Mykola Maslych, Wafa Al Ghallabi, Mihail Minkov Mihaylov, Chao Qin, Abdelrahman M. Shaker, Mike Zhang, Mahardika Krisna Ihsani, Amiel Gian Esplana, Monil Gokani, Shachar Mirkin, Harsh Singh, Ashay Srivastava, Endre Hamerlik, Fathinah Asma Izzati, Fadillah Adamsyah Maani, Sebastian Cavada, Jenny Chim, Rohit Gupta, Sanjay Manjunath, Kamila Zhumakhanova, Feno Heriniaina Rabevohitra, Azril Hafizi Amirudin, Muhammad Ridzuan, Daniya Najiha Abdul Kareem, Ketan Pravin More, Kunyang Li, Pramesh Shakya, Muhammad Saad, Amirpouya Ghasemaghaei, Amirbek Djanibekov, Dilshod Azizov, Branislava Jankovic, Naman Bhatia, Alvaro Cabrera, Johan S. Obando-Ceron, Olympiah Otieno, Fabian Farestam, Muztoba Rabbani, Sanoojan Baliah, Santosh Sanjeev, Abduragim Shtanchaev, Maheen Fatima, Thao Nguyen, Amrin Kareem, Toluwani Aremu, Nathan Augusto Zacarias Xavier, Amit Bhatkal, Hawau Olamide Toyin, Aman Chadha, Hisham Cholakkal, Rao Muhammad Anwer, Michael Felsberg, Jorma Laaksonen, Thamar Solorio, Monojit Choudhury, Ivan Laptev, Mubarak Shah, Salman H. Khan, Fahad Shahbaz Khan |
| 2025 | EMNLP | Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs. | Wafa Al Ghallabi, Ritesh Thawkar, Sara Ghaboura, Ketan Pravin More, Omkar Thawakar, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer |
| 2025 | EMNLP | MAviS: A Multimodal Conversational Assistant For Avian Species. | Yevheniia Kryklyvets, Mohammed Irfan Kurpath, Sahal Shaji Mullappilly, Jinxing Zhou, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman Khan, Hisham Cholakkal |
| 2025 | EMNLP | BiMediX2 : Bio-Medical EXpert LMM for Diverse Medical Modalities. | Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Sara Pieri, Saeed Yahya Alseiari, Shanavas Cholakkal, Khaled Aldahmani, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman H. Khan, Timothy Baldwin, Hisham Cholakkal |
| 2025 | ICCV | Adapting In-Domain Few-Shot Segmentation to New Domains Without Source Domain Retraining. | Qi Fan, Kaiqi Liu, Nian Liu, Hisham Cholakkal, Rao Muhammad Anwer, Wenbin Li, Yang Gao |
| 2025 | ICCV | All in One: Visual-Description-Guided Unified Point Cloud Segmentation. | Zongyan Han, Mohamed El Amine Boudjoghra, Jiahua Dong, Jinhong Wang, Rao Muhammad Anwer |
| 2025 | ICCV | TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models. | Ziyang Luo, Nian Liu, Xuguang Yang, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Junwei Han |
| 2025 | ICCV | Beyond Simple Edits: Composed Video Retrieval with Dense Modifications. | Omkar Thawakar, Dmitry Demidov, Ritesh Thawkar, Rao Muhammad Anwer, Mubarak Shah, Fahad Shahbaz Khan, Salman Khan |
| 2025 | ICCV | RAGNet: Large-Scale Reasoning-Based Affordance Segmentation Benchmark Towards General Grasping. | Dongming Wu, Yanping Fu, Saike Huang, Yingfei Liu, Fan Jia, Nian Liu, Feng Dai, Tiancai Wang, Rao Muhammad Anwer, Fahad Shahbaz Khan, Jianbing Shen |
| 2025 | ICLR | Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation. | Mohamed El Amine Boudjoghra, Angela Dai, Jean Lahoud, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Fahad Shahbaz Khan |
| 2025 | ICRA | Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking. | Ayesha Ishaq, Mohamed El Amine Boudjoghra, Jean Lahoud, Fahad Shahbaz Khan, Salman Khan, Hisham Cholakkal, Rao Muhammad Anwer |
| 2025 | IROS | DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding. | Ayesha Ishaq, Jean Lahoud, Ketan More, Omkar Thawakar, Ritesh Thawkar, Dinura Dissanayake, Noor Ahsan, Yuhao Li, Fahad Shahbaz Khan, Hisham Cholakkal, Ivan Laptev, Rao Muhammad Anwer, Salman H. Khan |
| 2025 | MICCAI | SPARTA: Spectral Prompt Agnostic Adversarial Attack on Medical Vision-Language Models. | Asif Hanif, Zaigham Zaheer, Salman Khan, Fahad Shahbaz Khan, Rao Muhammad Anwer |
| 2025 | NAACL | CAMEL-Bench: A Comprehensive Arabic LMM Benchmark. | Sara Ghaboura, Ahmed Heakl, Omkar Thawakar, Ali Husain Salem Abdulla Alharthi, Ines Riahi, Abduljalil Radman, Jorma Laaksonen, Fahad Shahbaz Khan, Salman Khan, Rao Muhammad Anwer |
| 2025 | WACV | AgroGPT : Efficient Agricultural Vision-Language Model with Expert Tuning. | Muhammad Awais, Ali Husain Salem Abdulla Alharthi, Amandeep Kumar, Hisham Cholakkal, Rao Muhammad Anwer |
| 2025 | WACV | Palo: A Polyglot Large Multimodal Model for 5B People. | Hanoona Abdul Rasheed, Muhammad Maaz, Abdelrahman M. Shaker, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Tim Baldwin, Michael Felsberg, Fahad Shahbaz Khan |
| 2024 | AAAI | Semi-supervised Open-World Object Detection. | Sahal Shaji Mullappilly, Abhishek Singh Gehlot, Rao Muhammad Anwer, Fahad Shahbaz Khan, Hisham Cholakkal |
| 2024 | CVPR | Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery. | Mubashir Noman, Muzammal Naseer, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Fahad Shahbaz Khan |
| 2024 | CVPR | GLaMM: Pixel Grounding Large Multimodal Model. | Hanoona Abdul Rasheed, Muhammad Maaz, Sahal Shaji Mullappilly, Abdelrahman M. Shaker, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Eric P. Xing, Ming-Hsuan Yang, Fahad Shahbaz Khan |
| 2024 | CVPR | Composed Video Retrieval via Enriched Context and Discriminative Embeddings. | Omkar Thawakar, Muzammal Naseer, Rao Muhammad Anwer, Salman H. Khan, Michael Felsberg, Mubarak Shah, Fahad Shahbaz Khan |
| 2024 | ECCV | Continual Learning and Unknown Object Discovery in 3D Scenes via Self-distillation. | Mohamed El Amine Boudjoghra, Jean Lahoud, Hisham Cholakkal, Rao Muhammad Anwer, Salman Khan, Fahad Shahbaz Khan |
| 2024 | ECCV | Efficient 3D-Aware Facial Image Editing via Attribute-Specific Prompt Learning. | Amandeep Kumar, Muhammad Awais, Sanath Narayan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer |
| 2024 | ECCV | CONDA: Condensed Deep Association Learning for Co-salient Object Detection. | Long Li, Nian Liu, Dingwen Zhang, Zhongyu Li, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal, Junwei Han, Fahad Shahbaz Khan |
| 2024 | EMNLP | BiMediX: Bilingual Medical Mixture of Experts LLM. | Sara Pieri, Sahal Shaji Mullappilly, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman H. Khan, Timothy Baldwin, Hisham Cholakkal |
| 2024 | ICLR | Modulate Your Spectrum in Self-Supervised Learning. | Xi Weng, Yunhao Ni, Tengwei Song, Jie Luo, Rao Muhammad Anwer, Salman Khan, Fahad Khan, Lei Huang |
| 2024 | ICML | Bidirectional Reciprocative Information Communication for Few-Shot Semantic Segmentation. | Yuanwei Liu, Junwei Han, Xiwen Yao, Salman Khan, Hisham Cholakkal, Rao Muhammad Anwer, Nian Liu, Fahad Shahbaz Khan |
| 2024 | ICRA | Long-Tailed 3D Semantic Segmentation with Adaptive Weight Constraint and Sampling. | Jean Lahoud, Fahad Shahbaz Khan, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan |
| 2024 | MICCAI | BAPLe: Backdoor Attacks on Medical Foundational Models Using Prompt Learning. | Asif Hanif, Fahad Shamshad, Muhammad Awais, Muzammal Naseer, Fahad Shahbaz Khan, Karthik Nandakumar, Salman H. Khan, Rao Muhammad Anwer |
| 2024 | MICCAI | DB-SAM: Delving into High Quality Universal Medical Image Segmentation. | Chao Qin, Jiale Cao, Huazhu Fu, Fahad Shahbaz Khan, Rao Muhammad Anwer |
| 2023 | BMVC | SA2-Net: Scale-aware Attention Network for Microscopic Image Segmentation. | Mustansar Fiaz, Moein Heidari, Rao Muhammad Anwer, Hisham Cholakkal |
| 2023 | CAIP | PSM-PS: Part-Based Signal Modulation for Person Search. | Reem Abdalla Sharif, Mustansar Fiaz, Rao Muhammad Anwer |
| 2023 | CVPR | Person Image Synthesis via Denoising Diffusion Model. | Ankan Kumar Bhunia, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Jorma Laaksonen, Mubarak Shah, Fahad Shahbaz Khan |
| 2023 | CVPR | Discriminative Co-Saliency and Background Mining Transformer for Co-Salient Object Detection. | Long Li, Junwei Han, Ni Zhang, Nian Liu, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan |
| 2023 | EMNLP | Arabic Mini-ClimateGPT : A Climate Change and Sustainability Tailored Arabic LLM. | Sahal Shaji Mullappilly, Abdelrahman M. Shaker, Omkar Thawakar, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Fahad Shahbaz Khan |
| 2023 | ICCV | Generative Multiplane Neural Radiance for 3D-Aware Image Generation. | Amandeep Kumar, Ankan Kumar Bhunia, Sanath Narayan, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Ming-Hsuan Yang, Fahad Shahbaz Khan |
| 2023 | ICCV | Multi-grained Temporal Prototype Learning for Few-shot Video Object Segmentation. | Nian Liu, Kepan Nan, Wangbo Zhao, Yuanwei Liu, Xiwen Yao, Salman Khan, Hisham Cholakkal, Rao Muhammad Anwer, Junwei Han, Fahad Shahbaz Khan |
| 2023 | MICCAI | Cross-Modulated Few-Shot Image Generation for Colorectal Tissue Classification. | Amandeep Kumar, Ankan Kumar Bhunia, Sanath Narayan, Hisham Cholakkal, Rao Muhammad Anwer, Jorma Laaksonen, Fahad Shahbaz Khan |
| 2023 | MICCAI | A Spatial-Temporal Deformable Attention Based Framework for Breast Lesion Detection in Videos. | Chao Qin, Jiale Cao, Huazhu Fu, Rao Muhammad Anwer, Fahad Shahbaz Khan |
| 2023 | MICCAI | 3D Mitochondria Instance Segmentation with Spatio-Temporal Transformers. | Omkar Thawakar, Rao Muhammad Anwer, Jorma Laaksonen, Orly Reiner, Mubarak Shah, Fahad Shahbaz Khan |
| 2023 | WACV | SAT: Scale-Augmented Transformer for Person Search. | Mustansar Fiaz, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan |
| 2022 | ACCV | PS-ARM: An End-to-End Attention-Aware Relation Mixer Network for Person Search. | Mustansar Fiaz, Hisham Cholakkal, Sanath Narayan, Rao Muhammad Anwer, Fahad Shahbaz Khan |
| 2022 | CVPR | PSTR: End-to-End One-Step Person Search With Transformers. | Jiale Cao, Yanwei Pang, Rao Muhammad Anwer, Hisham Cholakkal, Jin Xie, Mubarak Shah, Fahad Shahbaz Khan |
| 2022 | CVPR | Energy-based Latent Aligner for Incremental Learning. | K. J. Joseph, Salman Khan, Fahad Shahbaz Khan, Rao Muhammad Anwer, Vineeth N. Balasubramanian |
| 2022 | CVPR | Spatio-temporal Relation Modeling for Few-shot Action Recognition. | Anirudh Thatipelli, Sanath Narayan, Salman Khan, Rao Muhammad Anwer, Fahad Shahbaz Khan, Bernard Ghanem |
| 2022 | ECCV | DoodleFormer: Creative Sketch Drawing with Transformers. | Ankan Kumar Bhunia, Salman Khan, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan, Jorma Laaksonen, Michael Felsberg |
| 2022 | ECCV | Class-Agnostic Object Detection with Multi-modal Transformer. | Muhammad Maaz, Hanoona Abdul Rasheed, Salman Khan, Fahad Shahbaz Khan, Rao Muhammad Anwer, Ming-Hsuan Yang |
| 2022 | ECCV | EdgeNeXt: Efficiently Amalgamated CNN-Transformer Architecture for Mobile Vision Applications. | Muhammad Maaz, Abdelrahman M. Shaker, Hisham Cholakkal, Salman H. Khan, Syed Waqas Zamir, Rao Muhammad Anwer, Fahad Shahbaz Khan |
| 2022 | ECCV | Video Instance Segmentation via Multi-Scale Spatio-Temporal Split Attention Transformer. | Omkar Thawakar, Sanath Narayan, Jiale Cao, Hisham Cholakkal, Rao Muhammad Anwer, Muhammad Haris Khan, Salman Khan, Michael Felsberg, Fahad Shahbaz Khan |
| 2021 | BMVC | Structured Latent Embeddings for Recognizing Unseen Classes in Unseen Domains. | Shivam Chandhok, Sanath Narayan, Hisham Cholakkal, Rao Muhammad Anwer, Vineeth N. Balasubramanian, Fahad Shahbaz Khan, Ling Shao |
| 2021 | ICCV | Handwriting Transformers. | Ankan Kumar Bhunia, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan, Mubarak Shah |
| 2020 | CVPR | D2Det: Towards High Quality Object Detection and Instance Segmentation. | Jiale Cao, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao |
| 2020 | ECCV | SipMask: Spatial Information Preservation for Fast Image and Video Instance Segmentation. | Jiale Cao, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao |
| 2020 | ECCV | Count- and Similarity-Aware R-CNN for Pedestrian Detection. | Jin Xie, Hisham Cholakkal, Rao Muhammad Anwer, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao, Mubarak Shah |
| 2019 | CAIP | Multi-stream Convolutional Networks for Indoor Scene Recognition. | Rao Muhammad Anwer, Fahad Shahbaz Khan, Jorma Laaksonen, Nazar Zaki |
| 2019 | CVPR | Efficient Featurized Image Pyramid Network for Single Shot Detector. | Yanwei Pang, Tiancai Wang, Rao Muhammad Anwer, Fahad Shahbaz Khan, Ling Shao |
| 2019 | ICCV | Enriched Feature Guided Refinement Network for Object Detection. | Jing Nie, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao |
| 2019 | ICCV | Mask-Guided Attention Network for Occluded Pedestrian Detection. | Yanwei Pang, Jin Xie, Muhammad Haris Khan, Rao Muhammad Anwer, Fahad Shahbaz Khan, Ling Shao |
| 2019 | ICCV | Learning Rich Features at High-Speed for Single-Shot Object Detection. | Tiancai Wang, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao |
| 2019 | ICCV | Deep Contextual Attention for Human-Object Interaction Detection. | Tiancai Wang, Rao Muhammad Anwer, Muhammad Haris Khan, Fahad Shahbaz Khan, Yanwei Pang, Ling Shao, Jorma Laaksonen |
| 2018 | ICIP | Bottom-Up Attention Guidance for Recurrent Image Recognition. | Hamed R. Tavakoli, Ali Borji, Rao Muhammad Anwer, Esa Rahtu, Juho Kannala |
| 2012 | CVPR | Color attributes for object detection. | Fahad Shahbaz Khan, Rao Muhammad Anwer, Joost van de Weijer, Andrew D. Bagdanov, Mara Vanrell, Antonio M. Lpez |
| 2011 | CAIP | Color Contribution to Part-Based Person Detection in Different Types of Scenarios. | Rao Muhammad Anwer, David Vzquez, Antonio M. Lpez |
| 2011 | IBPRIA | Opponent Colors for Human Detection. | Rao Muhammad Anwer, David Vzquez, Antonio M. Lpez |