| 2025 | ICCV | Punching Bag vs. Punching Person: Motion Transferability in Videos. | Raiyaan Abdullah, Jared Claypoole, Michael Cogswell, Ajay Divakaran, Yogesh S. Rawat |
| 2025 | IJCNLP | MINDS: A Cross-Cultural Dialogue Corpus for Social Norm Classification and Adherence Detection. | Pritish Sahu, Anirudh Som, Ajay Divakaran, Dimitra Vergyri |
| 2025 | WACV | A Video is Worth 10, 000 Words: Training and Benchmarking with Diverse Captions for Better Long Video Retrieval. | Matthew Gwilliam, Michael Cogswell, Meng Ye, Karan Sikka, Abhinav Shrivastava, Ajay Divakaran |
| 2024 | ACL | BloomVQA: Assessing Hierarchical Multi-modal Comprehension. | Yunye Gong, Robik Shrestha, Jared Claypoole, Michael Cogswell, Arijit Ray, Christopher Kanan, Ajay Divakaran |
| 2024 | ACL | Demonstrations Are All You Need: Advancing Offensive Content Paraphrasing using In-Context Learning. | Anirudh Som, Karan Sikka, Helen Gent, Ajay Divakaran, Andreas Kathol, Dimitra Vergyri |
| 2024 | CVPR | DRESS : Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback. | Yangyi Chen, Karan Sikka, Michael Cogswell, Heng Ji, Ajay Divakaran |
| 2024 | CVPR | Probing Conceptual Understanding of Large Visual-Language Models. | Madeline Schiappa, Raiyaan Abdullah, Shehreen Azad, Jared Claypoole, Michael Cogswell, Ajay Divakaran, Yogesh S. Rawat |
| 2024 | EMNLP | Pelican: Correcting Hallucination in Vision-LLMs via Claim Decomposition and Program of Thought Verification. | Pritish Sahu, Karan Sikka, Ajay Divakaran |
| 2024 | NAACL | Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models. | Yangyi Chen, Karan Sikka, Michael Cogswell, Heng Ji, Ajay Divakaran |
| 2023 | CVPR | Class Prototypes based Contrastive Learning for Classifying Multi-Label and Fine-Grained Educational Videos. | Rohit Gupta, Anirban Roy, Claire Christensen, Sujeong Kim, Sarah Gerard, Madeline Cincebeaux, Ajay Divakaran, Todd Grindal, Mubarak Shah |
| 2023 | EACL | Multilingual Content Moderation: A Case Study on Reddit. | Meng Ye, Karan Sikka, Katherine Atwell, Sabit Hassan, Ajay Divakaran, Malihe Alikhani |
| 2023 | ICCV | TIJO: Trigger Inversion with Joint Optimization for Defending Multimodal Backdoored Models. | Indranil Sur, Karan Sikka, Matthew Walmer, Kaushik Koneripalli, Anirban Roy, Xiao Lin, Ajay Divakaran, Susmit Jha |
| 2023 | KDD | Predicting Information Pathways Across Online Communities. | Yiqiao Jin, Yeon-Chang Lee, Kartik Sharma, Meng Ye, Karan Sikka, Ajay Divakaran, Srijan Kumar |
| 2022 | CVPR | Hybrid Consistency Training with Prototype Adaptation for Few-Shot Learning. | Meng Ye, Xiao Lin, Giedrius Burachas, Ajay Divakaran, Yi Yao |
| 2022 | IJCAI | Detecting Out-Of-Context Objects Using Graph Contextual Reasoning Network. | Manoj Acharya, Anirban Roy, Kaushik Koneripalli, Susmit Jha, Christopher Kanan, Ajay Divakaran |
| 2022 | WACV | Challenges in Procedural Multimodal Machine Comprehension: A Novel Way To Benchmark. | Pritish Sahu, Karan Sikka, Ajay Divakaran |
| 2021 | ACII | Towards Understanding Confusion and Affective States Under Communication Failures in Voice-Based Human-Machine Interaction. | Sujeong Kim, Abhinav Garlapati, Jonah Lubin, Amir Tamrakar, Ajay Divakaran |
| 2021 | ICCV | Confidence Calibration for Domain Generalization under Covariate Shift. | Yunye Gong, Xiao Lin, Yi Yao, Thomas G. Dietterich, Ajay Divakaran, Melinda T. Gervasio |
| 2020 | ICPR | Fine-Tuning for One-Look Regression Vehicle Counting in Low-Shot Aerial Datasets. | Aneesh Rangnekar, Yi Yao, Matthew J. Hoffman, Ajay Divakaran |
| 2020 | WACV | Stacked Spatio-Temporal Graph Convolutional Networks for Action Segmentation. | Pallabi Ghosh, Yi Yao, Larry S. Davis, Ajay Divakaran |
| 2019 | EMNLP | Integrating Text and Image: Determining Multimodal Document Intent in Instagram Posts. | Julia Kruk, Jonah Lubin, Karan Sikka, Xiao Lin, Dan Jurafsky, Ajay Divakaran |
| 2019 | EMNLP | Sunny and Dark Outside?! Improving Answer Consistency in VQA through Entailed Question Generation. | Arijit Ray, Karan Sikka, Ajay Divakaran, Stefan Lee, Giedrius Burachas |
| 2019 | HCOMP | Can You Explain That? Lucid Explanations Help Human-AI Collaborative Image Retrieval. | Arijit Ray, Yi Yao, Rakesh Kumar, Ajay Divakaran, Giedrius Burachas |
| 2019 | ICCV | Align2Ground: Weakly Supervised Phrase Grounding Guided by Image-Caption Alignment. | Samyak Datta, Karan Sikka, Anirban Roy, Karuna Ahuja, Devi Parikh, Ajay Divakaran |
| 2018 | ECCV | Zero-Shot Object Detection. | Ankan Bansal, Karan Sikka, Gaurav Sharma, Rama Chellappa, Ajay Divakaran |
| 2016 | LAK | Multimodal analytics to study collaborative problem solving in pair programming. | Shuchi Grover, Marie A. Bienkowski, Amir Tamrakar, Behjat Siddiquie, David A. Salter, Ajay Divakaran |
| 2015 | ACII | The Tower Game Dataset: A multimodal dataset for analyzing social interaction predicates. | David A. Salter, Amir Tamrakar, Behjat Siddiquie, Mohamed R. Amer, Ajay Divakaran, Brian Lande, Darius Mehri |
| 2015 | ICMI | Exploiting Multimodal Affect and Semantics to Identify Politically Persuasive Web Videos. | Behjat Siddiquie, Dave Chisholm, Ajay Divakaran |
| 2014 | ICASSP | Emotion detection in speech using deep networks. | Mohamed R. Amer, Behjat Siddiquie, Colleen Richey, Ajay Divakaran |
| 2014 | WACV | Multimodal fusion using dynamic hybrid models. | Mohamed R. Amer, Behjat Siddiquie, Saad M. Khan, Ajay Divakaran, Harpreet S. Sawhney |
| 2013 | AIED | Leveraging a Generalized Tutoring Framework in Exploratory Simulations Of Ill-Defined Domains. | James M. Thomas, Ajay Divakaran, Saad M. Khan |
| 2013 | ICCV | Dynamic Pooling for Complex Event Recognition. | Weixin Li, Qian Yu, Ajay Divakaran, Nuno Vasconcelos |
| 2013 | WACV | Video event recognition using concept attributes. | Jingen Liu, Qian Yu, Omar Javed, Saad Ali, Amir Tamrakar, Ajay Divakaran, Hui Cheng, Harpreet S. Sawhney |
| 2012 | CVPR | Evaluation of low-level features and their combinations for complex event detection in open source videos. | Amir Tamrakar, Saad Ali, Qian Yu, Jingen Liu, Omar Javed, Ajay Divakaran, Hui Cheng, Harpreet S. Sawhney |
| 2012 | ICASSP | How to put it into words - using random forests to extract symbol level descriptions from audio content for concept detection. | Po-Sen Huang, Robert Mertens, Ajay Divakaran, Gerald Friedland, Mark Hasegawa-Johnson |
| 2011 | ISM | On the Applicability of Speaker Diarization to Audio Concept Detection for Multimedia Retrieval. | Robert Mertens, Po-Sen Huang, Luke R. Gottlieb, Gerald Friedland, Ajay Divakaran |
| 2009 | WACV | Recognition and volume estimation of food intake using a mobile device. | Manika Puri, Zhiwei Zhu, Qian Yu, Ajay Divakaran, Harpreet S. Sawhney |
| 2008 | ICASSP | Speech denoising using nonnegative matrix factorization with priors. | Kevin W. Wilson, Bhiksha Raj, Paris Smaragdis, Ajay Divakaran |
| 2006 | ICASSP | Generative Process Tracking for Audio Analysis. | Regunathan Radhakrishnan, Ajay Divakaran |
| 2005 | ICASSP | Layered dynamic mixture model for pattern discovery in asynchronous multi-modal streams [video applications]. | Lexing Xie, Lyndon S. Kennedy, Shih-Fu Chang, Ajay Divakaran, Huifang Sun, Ching-Yung Lin |
| 2004 | ICIP | Video mining: pattern discovery versus pattern recognition. | Ajay Divakaran, Kadir A. Peker, Shih-Fu Chang, Regunathan Radhakrishnan, Lexing Xie |
| 2004 | ICIP | Discovering meaningful multimedia patterns with audio-visual concepts and associated text. | Lexing Xie, Lyndon S. Kennedy, Shih-Fu Chang, Ajay Divakaran, Huifang Sun, Ching-Yung Lin |
| 2004 | VCIP | MPEG-7 meta-data enhanced encoder system for embedded systems. | Kohtaro Asai, Hirofumi Nishikawa, Daiki Kudo, Ajay Divakaran |
| 2003 | ICASSP | Comparing MFCC and MPEG-7 audio features for feature extraction, maximum likelihood HMM and entropic prior HMM for sports audio classification. | Ziyou Xiong, Regunathan Radhakrishnan, Ajay Divakaran, Thomas S. Huang |
| 2003 | ICASSP | Audio events detection based highlights extraction from baseball, golf and soccer games in a unified framework. | Ziyou Xiong, Regunathan Radhakrishnan, Ajay Divakaran, Thomas S. Huang |
| 2003 | ICIP | Feature selection for unsupervised discovery of statistical temporal structures in video. | Lexing Xie, Shih-Fu Chang, Ajay Divakaran, Huifang Sun |
| 2003 | ICIP | Generation of sports highlights using motion activity in combination with a common audio feature extraction framework. | Zixiang Xiong, Regunathan Radhakrishnan, Ajay Divakaran |
| 2002 | ICASSP | Structure analysis of soccer video with hidden Markov models. | Lexing Xie, Shih-Fu Chang, Ajay Divakaran, Huifang Sun |
| 2002 | ICIP | Motion activity-based extraction of key-frames from video shots. | Ajay Divakaran, Kadir A. Peker, Regunathan Radhakrishnan |
| 2002 | ICIP | Representation of motion activity in hierarchical levels for video indexing and filtering. | Xinding Sun, Ajay Divakaran, B. S. Manjunath |
| 2001 | CAIP | An Overview of MPEG-7 Motion Descriptors and Their Applications. | Ajay Divakaran |
| 2001 | ICIP | Constant pace skimming and temporal sub-sampling of video using motion activity. | Ajay Divakaran, Kadir A. Peker, Huifang Sun |
| 2000 | ICIP | A Region Based Descriptor for Spatial Distribution of Motion Activity for Compressed Video. | Ajay Divakaran, Kadir A. Peker, Huifang Sun |